国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:何杏宇,高锦,杨桂松,
单位:上海理工大学a.光电信息与计算机工程学院;b.出版学院,上海200093;
关键词:异构智能体,任务分配,博弈论,强化学习,
基金:国家自然科学基金资助项目(61602305,61802257);上海市自然科学基金资助项目(18ZR1426000,19ZR1477600);南通市科技局社会民生计划资助项目(MS12021060);浦东新区科技发展基金产学研专项资助项目(PKX2021-D10);敏捷智能计算四川省重点实验室开放式基金资助项目;;
现有的异构多智能体分布式强化学习方法往往采用统一的状态和动作空间定义,很难体现异构智能各自的特点,且无法实现异构智能体对任务环境的自适应优势互补与竞争。然而采用差异化的状态和动作空间定义又会给异构智能体之间的共识带来挑战。为了实现异构多智能体的协同工作,针对车机异构协同场景提出一种基于博弈共识的异构多智能体分布式强化学习方法。首先,为了实现车机自适应能耗互补,该方法为无人机定义了区别于车辆的分层动作策略网络,其中,上层动作可以实现无人机在执行任务和充电行为之间的自适应切换,充电行为对应的底层动作是对辅助无人机充电的车辆进行选择。另外,为了在交通拥塞情况下发挥车机各自的差异化竞争优势,该方法设计基于GS(Gale-Shapley)算法的博弈共识机制,定义与拥堵参数相关的激励因子以实现对车机的差异化任务参与引导,并根据激励因子进一步进行成本估计,以最终实现任务执行效率和平台成本的双重优化。实验结果表明,相比于现有方法,该方法在完成所有任务时所需的时间平均减少了7.58%,智能体的能量消耗平均降低了10.05%,证明该方法在效率和能耗方面更具优势。
来源:2025年第9期
《计算机应用研究》期刊编辑部