国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:韩金亮,任海菁,吴淞玮,蒋欣欣,刘凤凯,
单位:中国矿业大学a.数学学院;b.环境与测绘学院;c.安全工程学院;d.信息与控制工程学院,江苏徐州221116;
关键词:行动者—评论家算法,注意力机制,深度强化学习,机器人路径规划,
基金:国家自然科学基金资助项目(61501465);国家大学生创新训练项目(201910290053Z);;
针对行动者—评论家算法存在的经验学习样本维度高、策略梯度模型鲁棒性低等问题,依据多代理系统的信息协作优势,构建注意力机制网络并作为代理体,引入多层并行注意力机制网络模型对AC算法进行改进,提出一种基于多层并行注意力机制的柔性AC算法。将其用于解决动态未知环境下的机器人路径规划问题,可增强行动者的策略梯度鲁棒性并降低评论家的回归误差,实现机器人路径规划最优方案的快速收敛。实验结果表明,该算法有效克服机器人路径规划的局部最优,具有计算速度快、稳定收敛的优点。
来源:2020年第12期
《计算机应用研究》期刊编辑部