国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:赵婷婷,吴帅,杨梦楠,陈亚瑞,王嫄,杨巨成,
单位:天津科技大学人工智能学院,天津300457;
关键词:强化学习,互信息,意图控制,近端策略优化算法,
基金:国家自然科学基金资助项目(61976156);天津市企业科技特派员项目(20YDTPJC00560);;
强化学习主要研究智能体如何根据环境作出较好的决策,其核心是学习策略。基于传统策略模型的动作选择主要依赖于状态感知、历史记忆及模型参数等,其智能体行为很难受到控制。然而,当人类智能体完成任务时,通常会根据自身的意愿或动机选择相应的行为。受人类决策机制的启发,为了让强化学习中的行为选择可控,使智能体能够根据意图选择动作,将意图变量加入到策略模型中,提出了一种基于意图控制的强化学习策略学习方法。具体地,通过意图变量与动作的互信息最大化使两者产生高相关性,使得策略能够根据给定意图变量选择相关动作,从而达到对智能体的控制。最终,通过复杂的机器人控制仿真任务Mujoco验证了所提方法能够有效地通过意图变量控制机器人的移动速度和移动角度。
来源:2022年第11期
《计算机应用研究》期刊编辑部