论文
HARGO:HPC 任务上 LLM 的 RL 后训练 的异构感知奖励引导优化
HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks
摘要
受监督的 微调 (SFT) 可以为 大语言模型 (LLM) 配备高性能计算 (HPC) 任务的领域知识,例如数据竞争检测和基准问答。然而,仅靠知识并不能保证适合任务的行为:正确分类 88.65% 的 C/C++ 数据竞争样本的同一 SFT 模型会生成对事实查询的冗长、不精确的答案,其中 65.9% 的 MLPerf 响应超过 40 个字符。强化学习 (RL) 后训练 通过优化特定于任务的奖励而不是 词元级 模仿来解决这一差距。然而,HPC 任务表现出极端的异质性,二元分类、事实 QA 和语义生成的答案长度相差 58 倍,跨越三种不同的奖励分布,并且显示出差异很大的 SFT 准确性。这使得 GRPO 等均匀权重 RL 方法不是最优的。我们提出了 HARGO,异质性感知奖励引导优化,它通过置信度调制优势引入每个响应重要性加权:从组级奖励对比计算判别信号,从参考模型对数概率计算置信度信号,然后在计算每个响应权重之前调制优势,而不需要任务类型标签。在四个 HPC 任务和九种方法中,HARGO 在所有三个主要指标上实现了最佳性能:WinRate 54.62%、Data Race F1 91.30% 和 PLP 相似度 0.8558。消融证实了两个信号的互补贡献。 HARGO 在异构 HPC 任务的比较方法中建立了最佳的整体对齐质量。