基于DRL的高铁养修多资源调度优化方法OA
为提升高速铁路养护维修天窗时间的利用效率,化解多作业任务与有限设备、人力资源间的调度冲突,提出一种基于深度强化学习(DRL)的养修多资源调度优化(HG-PPO)方法。该方法将高铁养修资源调度问题建模为多资源柔性作业车间调度问题,通过动态异构图构建包含工序、设备和工人节点的三阶段特征嵌入架构,结合图注意力机制与多层感知机完成节点特征提取,并基于Actor-Critic结构的近端策略优化(PPO)框架进行求解。基于实际高铁车间的作业计划构造标准化测试数据集,对所提方法进行了系统评估。实验结果表明:HG-PPO方法在求解质量与计算效率上均优于传统方法;相较于精确优化方法、启发式规则及元启发式算法,该方法可有效缩短最大完工时间、降低超时率,平均求解时间仅为1.276 s,在复杂资源约束下可高效利用天窗时间,具备更优的调度性能。
张均;张渝;谢利明;朱培建;耿明
西南交通大学物理科学与技术学院,四川成都610031西南交通大学物理科学与技术学院,四川成都610031西南交通大学物理科学与技术学院,四川成都610031西南交通大学物理科学与技术学院,四川成都610031中铁第四勘察设计院集团有限公司,湖北武汉430063
信息技术与安全科学
高铁养修资源调度柔性作业车间调度深度强化学习图神经网络近端策略优化最大完工时间
《现代电子技术》 2026 (14)
P.169-175,180,8
国家重点研发计划(2023YFB2603700)。
评论