论文
不只追求速度:以仿真反馈强化学习生成节能代码
Beyond the Need for Speed: Energy-Aware Code Generation via Simulation-Guided Reinforcement Learning
摘要
代码模型通常优先保证功能正确,软件能效未被直接优化。节能代码训练需要大规模可重复反馈,但物理硬件测量受波动影响。研究以确定性架构仿真Harness代替硬件性能测量,构建Green Tea语料,包含1,474道C++题上的350万次评估。模型先用能耗对比样本进行监督微调,再以仿真反馈进行闭环GRPO强化学习。评估采用正确性调整后的总能耗降幅CARET,惩罚通过牺牲功能换取能效的代码。在143道留出题上,该流程取得12.63%的CARET,接近单独微调收益的三倍;58.4%的有效输出比人工专家参考代码更节能。每周期指令数IPC等吞吐代理指标在67.8%的题目上错误排序真实能效,表明此设置需要直接能耗仿真。发布的数据与基础设施可免去复现时所需的263,000 CPU小时计算。