基于两阶段深度强化学习的微电网能量管理策略OA
针对现有深度强化学习算法中存在的探索成本高、训练效率低的问题,文章提出了一种基于两阶段深度强化学习的微电网能量管理策略。首先,在离线阶段,用线性规划获得典型日的最优调度结果,形成专家经验库,进而用模仿学习方法对智能体进行预训练。然后,在在线阶段,智能体与实际环境进行实时交互,学习并优化非典型日的调度策略。另外,在线阶段应用悬崖漫步奖励机制,当智能体探索超出约束范围时立刻停止探索,减少了无效探索带来的训练成本。仿真结果表明,与单阶段深度强化学习算法相比,两阶段深度强化学习策略显著提升了智能体的训练效率和优化性能。
陆玲霞;胡明颉;罗玮烨;于淼
浙江大学电气工程学院,浙江杭州310027浙江大学电气工程学院,浙江杭州310027浙江大学电气工程学院,浙江杭州310027浙江大学电气工程学院,浙江杭州310027
信息技术与安全科学
两阶段深度强化学习微电网能量管理奖励机制训练效率
《实验技术与管理》 2026 (6)
P.37-46,10
国家自然科学基金联合基金项目(U21A20485)2026年度浙江省自然科学基金资助项目(LMS26F030001)浙江省“十四五”第二批本科省级教学改革备案项目(JGBA2024014)教育部产学合作协同育人项目(2501270945)2024年度浙江大学本科“AI赋能”示范课程建设项目(202424EE2501M)浙江大学第四批AI For Education系列实证教学研究项目(BKSY20251104)。
评论