计算机应用研究

北大核心,JST,Pж(AJ),CSCD扩展版,WJCI

国内刊号:51-1196/TP

国际刊号:1001-3695

计算机应用研究杂志2024年第5期:异策略模仿-强化学习序列推荐算法

发布日期:

作者:刘珈麟,贺泽宇,李俊,

单位:1.中国科学院计算机网络信息中心,北京100045;2.中国科学院大学,北京100045;3.北京信息科技大学计算机学院,北京100101;

关键词:异策略评估,模仿学习,逆强化学习,序列推荐,

基金:国家自然科学基金资助项目(61672490,61602436);中国科学院对外合作重点项目(241711KYSB20180002);国家重大研发计划子课题(2022YFC3320900);;

最近,强化学习序列推荐系统受到研究者们的广泛关注,这得益于它能更好地联合建模用户感兴趣的内动态和外倾向。然而,现有方法面临同策略评估方法数据利用率低,导致模型依赖大量的专家标注数据,以及启发式价值激励函数设计依赖反复人工调试两个主要挑战。因此,提出了一种新颖的异策略模仿-强化学习的序列推荐算法COG4Rec,以提高数据利用效率和实现可学习的价值函数。首先,它通过异策略方式更新分布匹配目标函数,来避免同策略更新密集在线交互限制;其次,COG4Rec采用可学习的价值函数设计,通过对数衰减状态分布比,模仿用户外倾向的价值激励函数;最后,为了避免模仿学习分布漂移问题,COG4Rec通过累积衰减分布比,强化用户行为记录中高价值轨迹片段重组推荐策略。一系列基准数据集上的性能对比实验和消融实验结果表明:COG4Rec比自回归模型提升了17.60%,它比启发式强化学习方法提升了3.25%。这证明了所提模型结构和优化算法的有效性。这也证明可学习的价值函数是可行的,并且异策略方式能有效提高数据利用效率。

来源:2024年第5期

《计算机应用研究》期刊编辑部

查看计算机应用研究杂志2024年第5期

联系我们

  • 地址:四川省成都市武候区成科西路3号
  • 电话:028-85249567
  • E-mail:journal@arocmag.cn

咨询工作人员