国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:李竹,傅启明,丁正凯,刘璐,张颖,陈建平,
单位:1.苏州科技大学a.电子与信息工程学院;b.江苏省建筑智慧节能重点实验室;c.建筑与城市规划学院,江苏苏州215009;2.重庆工业大数据创新中心有限公司,重庆400707;
关键词:强化学习,事件驱动,暖通空调,住宅建筑,热舒适,
基金:国家重点研发计划资助项目(2020YFC2006602);国家自然科学基金资助项目(62102278,62172324,61876217,61876121);江苏省高等学校自然科学研究项目(21KJA520005);江苏省重点研发计划资助项目(BE2020026);江苏省自然科学基金资助项目(BK20190942);江苏省研究生教育教学改革项目;;
住宅暖通空调系统通常耗用大量能源,同时也极大地影响居住者的热舒适性。目前,强化学习广泛应用于优化暖通空调系统,然而这一方法需要投入大量时间和数据资源。为了解决该问题,提出了一个新的基于事件驱动的马尔可夫决策过程(event-driven Markov decision process,ED-MDP)框架,并在此基础上,提出了基于事件驱动的深度确定性策略梯度(event-driven deep deterministic policy gradient,ED-DDPG)方法,通过事件触发优化控制,结合强化学习算法求解最优控制策略。实验结果显示,与基准方法相比,ED-DDPG在提升学习速度和减少决策频率方面表现出色,并在节能和维持热舒适方面取得了显著成果。经过实验验证,该方法在优化住宅暖通空调控制方面展现出强大的鲁棒性和适应性。
来源:2024年第2期
《计算机应用研究》期刊编辑部