计算机应用研究

北大核心,JST,Pж(AJ),CSCD扩展版,WJCI

国内刊号:51-1196/TP

国际刊号:1001-3695

计算机应用研究杂志2021年第6期:双Q网络学习的迁移强化学习算法

发布日期:

作者:曾睿,周建,刘满禄,张俊俊,陈卓,

单位:西南科技大学a.制造科学与工程学院;b.特殊环境机器人技术四川省重点实验室;c.信息工程学院,四川绵阳621000;

关键词:深度强化学习,双Q网络学习,actor-critic框架,迁移学习,

基金:国家“十三五”核能开发项目(20161295);国家科技重大专项资助项目(2019ZX06002022);;

深度强化学习在训练过程中会探索大量环境样本,造成算法收敛时间过长,而重用或传输来自先前任务(源任务)学习的知识,对算法在新任务(目标任务)的学习具有提高算法收敛速度的潜力。为了提高算法学习效率,提出一种双Q网络学习的迁移强化学习算法,其基于actor-critic框架迁移源任务最优值函数的知识,使目标任务中值函数网络对策略作出更准确的评价,引导策略快速向最优策略方向更新。将该算法用于Open AI Gym以及在三维空间机械臂到达目标物位置的实验中,相比于常规深度强化学习算法取得了更好的效果,实验证明提出的双Q网络学习的迁移强化学习算法具有较快的收敛速度,并且在训练过程中算法探索更加稳定。

来源:2021年第6期

《计算机应用研究》期刊编辑部

查看计算机应用研究杂志2021年第6期

联系我们

  • 地址:四川省成都市武候区成科西路3号
  • 电话:028-85249567
  • E-mail:journal@arocmag.cn

咨询工作人员