国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:朱荣鑫,王譞,刘峰,赵志宏,
单位:1.海南大学网络空间安全学院,海口570208;2.南京特殊教育师范学院,南京210038;3.南京大学软件学院,南京210093;4.南京工业大学,南京211816;
关键词:部分可观测马尔可夫决策过程,可达信念空间,智能体规划,
基金:国家重点研发计划资助项目(2018YFC1801605);国家软件新技术重点实验室面上项目(ZZKT2021B08);;
基于点的值迭代算法是一类解决 POMDP 问题的有效算法,PBVI 是基于点集的经典算法,但是其算法效率较为低下。FSVI使用内在的 MDP 最优策略来降低算法复杂度,但求解大规模问题的效果较差。为解决上述问题,提出了基于环境状态分布优化的前向搜索值迭代算法(PBVI-OSD),通过基于权重值的QMDP选出最佳的动作,基于信念状态和转换函数选取最大可能的状态,基于动作和状态从观察中随机选取一个观察概率大于阈值的观察,由此获得更具探索价值的后继信念点集,提升值迭代收敛的质量。在四个基准问题上的实验表明,相比于 FSVI 和 PBVI,PBVI-OSD能保证收敛效率,特别是在大规模问题上能收敛到更好的全局最优解。
来源:2022年第2期
《计算机应用研究》期刊编辑部