首页|期刊导航|南通大学学报(自然科学版)|基于模型集成强化学习方法的股指期货交易策略

基于模型集成强化学习方法的股指期货交易策略OA

中文摘要

针对股指期货市场,本文基于优势演员-评论家(advantage actor-critic,A2C)算法与近端策略优化(proximal policy optimization,PPO)算法,设计了集成强化学习量化交易策略。首先,采用极端梯度提升(extreme gradient boosting,XGBoost)模型筛选关键技术因子作为模型的状态输入变量,并结合交易成本约束完成奖励函数的优化设计。其次,分别对A2C和PPO模型进行超参数调优,确定隐藏层结构、学习率、批处理参数等关键超参数的最优取值。在此基础上,构建集成模型框架,通过验证集夏普比率对比实现基模型动态选择。回测结果表明:所提出的集成模型在沪深300指数、上证50指数和中证500指数这3个指数上的累计收益分别为106766、84739和78408元;年化收益率达32.03%、25.42%和23.52%;夏普比率分别为1.95、0.63和1.39;各项指标显著优于单一A2C模型、单一PPO模型及买入持有策略、动量策略两类基准策略。本文提出的策略可通过动态融合各基模型的性能优势,在市场波动环境中实现更低的最大回撤和更稳健的收益表现,尤其在中证500指数下跌行情中仍能保持正收益,充分验证了其抗风险能力和市场适应性。

刘磊;张凤敏;钱成

河海大学数学学院,江苏南京211100河海大学数学学院,江苏南京211100上海立信会计金融学院统计与数学学院,上海201209

信息技术与安全科学

深度强化学习优势演员-评论家模型近端策略优化模型集成模型股指期货市场奖励函数夏普比率

《南通大学学报(自然科学版)》 2026 (2)

P.14-23,10

教育部人文社会科学研究项目(25YJAZH108)。

10.12194/j.ntu.20240929001

评论