国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:赵英,秦进,
单位:贵州大学计算机科学与技术,贵阳550025;
关键词:积极状态,子目标,技能,技能评估,
基金:贵州省科学技术基金资助项目(黔科合基础[2020]1Y275);贵州省科技计划项目(黔科合基础[2019]1130号);;
现有的内在奖励随着agent不断探索环境而逐渐消失,导致了agent无法利用内在奖励信号去指引agent寻找最优策略。为了解决这个问题,提出了一种基于内在奖励的技能获取和组合方法。该方法首先在agent与环境交互过程中寻找积极状态,在积极状态中筛选子目标;其次从初始状态到达子目标,子目标到达终止状态所产生的一条轨迹中发现技能,对技能中出现一个或者两个以上的子目标进行组合;最后用初始状态到子目标的距离和初始状态到子目标的累积奖励值对技能进行评估。该方法在Mujoco环境中取得了较高的平均奖励值,尤其是在外在奖励延迟的情况下,也能取得较好的平均奖励值。说明该方法提出的子目标和技能可以有效地解决内在奖励消失后,agent无法利用内在奖励信号学习最优策略的问题。
来源:2022年第12期
《计算机应用研究》期刊编辑部