国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:焦昌成,王少威,
单位:1.武汉科技大学a.计算机科学与技术学院;b.机器人与智能系统研究院,武汉430065;2.智能信息处理与实时工业系统湖北省重点实验室,武汉430065;
关键词:三维迷宫,奖励设计,强化学习,事件触发,
基金:国家自然科学基金资助项目(62073249);湖北省技术创新专项重大资助项目(2019AAA071);;
动态三维迷宫是较为困难的、具有不确定性和不完全信息的强化学习任务环境,使用常规奖励函数在此环境中训练任务,速度缓慢甚至可能无法完成。为解决利用强化学习在动态迷宫中寻找多目标的问题,提出一种基于事件触发的综合奖励方案。该方案将三维迷宫中各种行为状态表达为各种事件,再由事件驱动奖励。奖励分为环境奖励和内部奖励,其中环境奖励与三维迷宫任务直接相关,含有体现任务目标的节点奖励和任务约束的约束奖励。内部奖励与智能体学习过程中的状态感受相关,含有判断奖励和心情奖励。在实验中,综合奖励的性能均值相较于改进奖励提升54.66%。结果表明,综合奖励方案在提高完成任务满意度、增强探索能力、提升训练效率方面具有优势。
来源:2024年第6期
《计算机应用研究》期刊编辑部