国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:米德昌,王霄,李梦丽,秦俊康,
单位:贵州大学电气工程学院,贵阳550025;
关键词:灾害应急,任务卸载,多智能体深度强化学习,自适应差分进化算法,
基金:国家自然科学基金资助项目(61861007,61640014);贵州省科技计划资助项目(黔科合基础-ZK[2021]一般303);贵州省科技支撑计划资助项目(科合支撑[2022]一般017,黔科合支撑[2023]一般096,黔科合支撑[2022]一般264);贵州省教育厅创新群体项目(黔教合KY字[2021]012);贵大引进人才项目(贵大人基合字(2014)08号);;
针对传统深度强化学习(deep reinforcement learning,DRL)中收敛速度缓慢、经验重放组利用率低的问题,提出了灾害应急场景下基于多智能体深度强化学习(MADRL)的任务卸载策略。首先,针对MEC网络环境随时隙变化且当灾害发生时传感器数据多跳的问题,建立了灾害应急场景下基于MADRL的任务卸载模型;然后,针对传统DRL由高维动作空间导致的收敛缓慢问题,利用自适应差分进化算法(ADE)的变异和交叉操作探索动作空间,提出了自适应参数调整策略调整ADE的迭代次数,避免DRL在训练初期对动作空间的大量无用探索;最后,为进一步提高传统DRL经验重放组中的数据利用率,加入优先级经验重放技术,加速网络训练过程。仿真结果表明,ADE-DDPG算法相比改进的深度确定性策略梯度网络(deep deterministic policy gradient,DDPG)节约了35%的整体开销,验证了ADE-DDPG在性能上的有效性。
来源:2023年第12期
《计算机应用研究》期刊编辑部