基于改进强化学习的多阶段动态武器目标分配OA
针对现代作战环境中多波次、高动态的武器目标分配问题,融合了武器可用时间、武器冷却间隔及目标打击时间窗等实际调度限制,构建了一个同时考虑目标威胁消除、基地保卫与阶段间资源协调的多目标优化函数,用于提升调度策略的前瞻性与整体效益。在算法设计上,提出了一种改进Actor-Critic算法,将指针网络融入Actor模块,利用其注意力机制与动态掩码能力,实现了在变长输入下对武器-目标对的高效筛选,并采用双通道编码-解码机制,提升了算法的求解精度。实验部分涵盖了目标函数有效性验证、算法性能对比分析、泛化能力测试及注意力机制与正则化模块的消融分析,验证了所提模型与算法在复杂动态环境中的优化能力与适应性。
邹尧;刘天娇;吕旭;张艳玲;郭文达
北京科技大学智能科学与技术学院,北京100083 智能仿生无人系统教育部重点实验室,北京100083北京科技大学智能科学与技术学院,北京100083 智能仿生无人系统教育部重点实验室,北京100083中国兵器科学研究院,北京100089北京科技大学智能科学与技术学院,北京100083 智能仿生无人系统教育部重点实验室,北京100083北京科技大学智能科学与技术学院,北京100083 智能仿生无人系统教育部重点实验室,北京100083
军事科技
武器目标分配时间窗约束强化学习指针网络
《信息与控制》 2026 (2)
P.292-305,14
国家自然科学基金项目(62422304、62427813)自主智能无人系统全国重点实验室开放课题(ZZKF2025-1-6)。
评论