首页|期刊导航|计算机应用研究|融合课程学习与自适应奖励塑形的移动机器人导航方法

融合课程学习与自适应奖励塑形的移动机器人导航方法OA

Mobile robot navigation method based on integrated course learning and adaptive reward shaping

中文摘要英文摘要

针对移动机器人端到端导航任务时面临稀疏奖励的问题,传统强化学习方法容易出现学习效率低,难以稳定收敛等问题,提出一种融合课程学习与自适应碰撞熵奖励塑形的深度强化学习导航方法.首先,引入激光扫描碰撞熵作为动态塑形项,用于衡量环境不确定性并引导智能体在复杂空间中更高效地探索.其次,设计了基于成功率变化斜率的自适应调度机制,动态调整塑形系数β,从而平衡探索与收敛的关系.最后,构建了分阶段的课程学习框架,通过逐步提升环境难度,使智能体在由简到难的任务序列中稳定学习,加快收敛速度并提升最终性能.在仿真环境的验证中,相较于同领域主流方法,该方法在密集环境下成功率提升至84.5%,碰撞率降至14.5%.验证了该方法能够有效缓解稀疏奖励问题并提升导航性能.

Sparse rewards in end-to-end mobile robot navigation often lead to low learning efficiency and unstable convergence in conventional reinforcement learning methods.This study developed a deep reinforcement learning approach that integrated curriculum learning and adaptive collision entropy reward shaping.It introduced collision entropy derived from 2D LiDAR as a dynamic shaping term to quantify environmental uncertainty and guide obstacle-aware exploration.An adaptive scheduling mechanism adjusted the shaping coefficient β according to the slope of success rate variation,which balanced exploration and convergence during training.A staged curriculum progressively increased environmental difficulty to stabilize learning.Simula-tion results show that the proposed method achieves an 84.5%success rate and reduces the collision rate to 14.5%in dense environments.The method effectively alleviates sparse reward issues and improves navigation performance.

林玉杰;吴伟林;付占悦;蔡君颖;石少雄

广西民族大学 物理与电子信息学院,南宁 530028广西民族大学 物理与电子信息学院,南宁 530028||广西智语人形机器人重点实验室,南宁 530006||多模态信息智能感知处理与应用广西高校工程研究中心,南宁 530006广西民族大学 物理与电子信息学院,南宁 530028广西民族大学 物理与电子信息学院,南宁 530028广西民族大学 物理与电子信息学院,南宁 530028

信息技术与安全科学

深度强化学习碰撞熵课程学习自适应奖励塑形移动机器人导航

deep reinforcement learningcollision entropycurriculum learningadaptive reward shapingmobile robot navigation

《计算机应用研究》 2026 (8)

2301-2307,7

广西民族大学科研基金资助项目(21KJQD20)广西重点研发计划资助项目(桂科AB25069215)广西民族大学相思湖青年学者创新团队项目(2023GXUNXSHQN06)国家自然科学基金资助项目(62241302)

10.19734/j.issn.1001-3695.2025.12.0501

评论