计算机应用研究

北大核心,JST,Pж(AJ),CSCD扩展版,WJCI

国内刊号:51-1196/TP

国际刊号:1001-3695

计算机应用研究杂志2023年第6期:安全约束下合作型多智能体TD3算法

发布日期:

作者:郝禹哲,王振雷,

单位:华东理工大学能源化工过程智能制造教育部重点实验室,上海200237;

关键词:安全强化学习,多智能体,拉格朗日乘子法,

基金:国家自然科学基金重大项目课题(62293502,62173147);中央高校基本科研业务费专项资金资助项目(222202317006);高等学校学科创新引智计划资助项目(B17017);上海人工智能实验室资助项目;;

合作马尔可夫博弈中,每个智能体不仅要实现共同的目标,还需要保证联合动作能够满足设定的约束条件。为此提出了安全约束下的合作型多智能体TD3算法MACTD3 (multi-agent constrainted twin delayed deep deterministic policy gradient)。首先,结合注意力机制对各个智能体采取的动作与决策过程约束条件进行了协调。然后利用拉格朗日乘子构造了修正的代价函数。进而为保证算法的收敛性,保证每一个智能体能够满足预先设定的约束条件,设计了不同时间尺度分学习策略:在短时间尺度上执行Actor-Critic网络的梯度下降,在长时间尺度上对拉格朗日参数进行迭代。最后在异质和同质的合作型多智能体环境下进行实验。实验结果表明,与其他算法相比,提出的MACTD3算法始终能够获得最小的惩罚成本;通过数量的扩展性实验表明了MACTD3在不同数量智能体的情况下仍然能够满足约束条件,证明了算法的有效性与扩展性。

来源:2023年第6期

《计算机应用研究》期刊编辑部

查看计算机应用研究杂志2023年第6期

联系我们

  • 地址:四川省成都市武候区成科西路3号
  • 电话:028-85249567
  • E-mail:journal@arocmag.cn

咨询工作人员