论文
迈向理解推理模型中的规范投机(Specification Gaming)
Towards Understanding Specification Gaming in Reasoning Models
摘要
规范投机是LLM智能体的关键失败模式。尽管如此,关于它何时出现、由什么驱动,仍缺乏系统研究。为此我们构建并开源了一套多样化任务套件,模型在其中可以通过非预期动作获得高分。我们发现:在八个 setting 中的大多数里,所有受测模型都以不可忽视的比率利用其规范,其中包括五个非编码 setting。规范投机率最高的是Grok 4,最低的是Claude系列。我们用该评估套件研究驱动规范投机的因素,发现:1. RL推理训练大幅提高模型利用规范的比率;2. 增大RL推理预算对投机率有弱正向影响;3. 测试时缓解手段能降低但不能消除规范投机率。我们的结果提示:规范投机是RL推理训练带来的根本性挑战;我们开源评估套件以支持对该问题的后续研究。
