国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:邹长杰,郑皎凌,张中雷,
单位:成都信息工程大学软件工程学院,成都610225;
关键词:强化学习,群体协作,深度学习,群体智慧,
基金:国家自然科学基金资助项目(61772091,61802035);;
目前多智能体强化学习算法多采用集中学习,分散行动的框架。该框架存在算法收敛时间过长和可能无法收敛的问题。为了加快多智能体的集体学习时间,提出多智能体分组学习策略。通过使用循环神经网络预测出多智能体的分组矩阵,通过在分组内部共享智能体之间经验的机制,提高了多智能体的团队学习效率;同时,为了弥补分组带来的智能体无法共享信息的问题,提出了信息微量的概念在所有智能体之间传递部分全局信息;为了加强分组内部优秀经验的留存,提出了推迟组内优秀智能体死亡时间的生灭过程。最后,在迷宫实验中,训练时间比MADDPG减少12%;夺旗实验中,训练时间比MADDPG减少17%。
来源:2020年第12期
《计算机应用研究》期刊编辑部