首页|期刊导航|智能系统学报|动态距离约束的离线到在线强化学习

动态距离约束的离线到在线强化学习OA

中文摘要

离线到在线强化学习能够在有限的在线交互下快速提升策略性能,但在微调初期,策略分布往往偏离离线数据支持区域,导致估值不稳并限制性能提升。现有方法多依赖统一的保守约束,将离线数据视作边界条件,却忽视了样本质量与分布差异,从而在更新时既过度约束,又难以避免分布外的不稳定估值。为此,本文提出一种动态距离约束的离线到在线强化学习算法。该方法基于状态条件距离函数,将策略约束在离线数据支持区域内,并随着在线交互的进行,动态地将约束放宽至高质量数据区域,从而实现离线到在线的平滑迁移。实验结果表明,与现有主流方法相比,所提出的方法可以在多个模拟任务上实现稳定有效的性能改进。

赵若涵;魏巍;王达;黄利

山西大学计算机与信息技术学院,山西太原030006山西大学计算机与信息技术学院,山西太原030006山西大学计算机与信息技术学院,山西太原030006山西大学计算机与信息技术学院,山西太原030006

信息技术与安全科学

机器学习强化学习离线到在线强化学习马尔可夫过程策略优化距离约束策略迁移约束优化

《智能系统学报》 2026 (4)

P.1055-1065,11

国家自然科学基金项目(62276160)山西省基础研究计划(202203021211294).

10.11992/tis.202510017

评论