国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:宋江帆,李金龙,
单位:中国科学技术大学计算机科学与技术学院,合肥230000;
关键词:强化学习,连续时间,策略梯度,动作重复,
在强化学习中,策略梯度法经常需要通过采样将连续时间问题建模为离散时间问题。为了建模更加精确,需要提高采样频率,然而过高的采样频率可能会使动作改变频率过高,从而降低训练效率。针对这个问题,提出了动作稳定更新算法。该方法使用策略函数输出的改变量计算动作重复的概率,并根据该概率随机地重复或改变动作。在理论上分析了算法性能。之后在九个不同的环境中评估算法的性能,并且将它和已有方法进行了比较。该方法在其中六个环境下超过了现有方法。实验结果表明,动作稳定更新算法可以有效提高策略梯度法在连续时间问题中的训练效率。
来源:2023年第10期
《计算机应用研究》期刊编辑部