国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:乔和,李增辉,刘春,胡嗣栋,
单位:辽宁工程技术大学电气与控制工程学院,辽宁葫芦岛125105;
关键词:深度强化学习,知识蒸馏,近端策略优化,稀疏奖励,内在好奇心,
基金:国家自然科学基金资助项目(51604141,51204087);;
在深度强化学习方法中,针对内在好奇心模块(intrinsic curiosity model,ICM)指导智能体在稀疏奖励环境中获得未知策略学习的机会,但好奇心奖励是一个状态差异值,会使智能体过度关注于对新状态的探索,进而出现盲目探索的问题,提出了一种基于知识蒸馏的内在好奇心改进算法(intrinsic curiosity model algorithm based on knowledge distillation,KD-ICM)。首先,该算法引入知识蒸馏的方法,使智能体在较短的时间内获得更丰富的环境信息和策略知识,加速学习过程;其次,通过预训练教师神经网络模型去引导前向网络,得到更高精度和性能的前向网络模型,减少智能体的盲目探索。在Unity仿真平台上设计了两个不同的仿真实验进行对比,实验表明,在复杂仿真任务环境中,KD-ICM算法的平均奖励比ICM提升了136%,最优动作概率比ICM提升了13.47%,提升智能体探索性能的同时能提高探索的质量,验证了算法的可行性。
来源:2024年第9期
《计算机应用研究》期刊编辑部