基于增强型强化学习的非规则访存预取框架OA
高性能计算和智能计算中非规则数据访问模式常常导致传统数据预取技术失效,而以往依赖利用固定规则或基于特定程序上下文的离线学习模型也难以适应运行时动态变化的访存模式。虽然Pythia强化学习(RL)预取框架通过在线学习展现出良好的适应性,但在极端非规则负载下仍需要针对性调优,限制了实际应用的泛化能力。文中提出一种上下文感知的强化学习预取框架IEP(Irregular Enhanced Pythia),旨在增强对非规则访存模式的预测能力。该框架包含两方面创新:其一,提出非规则特征增强模块,引入地址位掩码和访问顺序距离两类状态特征,捕捉内存分配器行为在时间和空间上潜藏的规律,从而提升对非规则访存的表征能力;其二,提出分层奖励策略模块,通过信心感知与带宽敏感的动态奖励机制,精细化地引导智能体学习过程,从而加速策略优化并提升最终性能。实验基于ChampSim仿真器,测试多种非规则负载。实验结果表明,相比Pythia框架,文中方案在Ligra、PARSEC等典型非规则负载上的平均准确率最高提升2.27%,单核平均IPC最高提升2.90%,并在多核环境下保持稳定性能。
杨钰泽;黄正伟;王永文
国防科技大学计算机学院,长沙410073 先进微处理器芯片与系统重点实验室,长沙410073国防科技大学计算机学院,长沙410073 先进微处理器芯片与系统重点实验室,长沙410073国防科技大学计算机学院,长沙410073 先进微处理器芯片与系统重点实验室,长沙410073
信息技术与安全科学
非规则访存硬件预取强化学习ChampSim状态特征动态奖励机制
《集成电路与嵌入式系统》 2026 (8)
P.1-18,18
高层次科技创新人才工程人选自主科研项目(22-TDRCJH-02-006)。
评论