基于深度强化学习的多状态系统维护策略OA
针对传统维护方法在处理不完全观测和多状态系统时在计算上易遭受维度灾难的问题,提出了一种基于深度强化学习的多状态不完全观测系统维护策略。首先,构建基于不完全观测马尔可夫决策过程的维护策略模型;然后,采用深度学习框架进行求解,在该框架下提出了改进的DDQN(double deep Q-network)算法,通过采用优先经验回放(PER)技术优化经验回放过程并通过深度神经网络估计价值函数,有效地解决了传统DDQN在训练过程中样本利用率低的问题,从而提高了DDQN算法的学习效率和收敛速度。为验证模型的有效性和改进算法的高效性,以实际的焦炉气制甲醇工艺系统为研究对象给出数值算例。算例结果显示,改进算法在维护效率和系统可靠性方面显著优于传统方法,证明了模型的有效性,为复杂系统的维护问题提供决策支持。
金海波;安晓鹏
辽宁工程技术大学软件学院,辽宁葫芦岛125105辽宁工程技术大学软件学院,辽宁葫芦岛125105
信息技术与安全科学
深度强化学习多状态系统DDQN维护策略
《信息与控制》 2026 (3)
P.556-572,17
国家自然科学基金面上项目(62173171)。
评论