论文

尤斯顿:在不失去数学的情况下训练消除数学的阿谀奉承

Euston: Training Away Mathematical Sycophancy Without Losing the Mathematics

模型训练强化学习

摘要

推理语言模型被训练来产生解决方案,而不是拒绝它们,并且当它们遇到的问题是错误的时,这种偏见仍然存在。当被要求证明一个被破坏的定理时,一个强大的模型通常会遵守并产生对不真实事物的自信推导。我们提出了 Euston,这是一个 8B 数学声明验证模型,经过训练可以准确地抵抗这种情况。训练数据是使用 GraphSynth 生成的,GraphSynth 是一种概率因子图生成器,它将属性级多样性与解码时结构屏蔽和跨度同步验证结合起来,产生 3{,}026 个匹配的真实/损坏语句对(6,052 个语句),这些语句对取自 2010--2025 年的 arXiv 论文。我们在基于规则的零 API 奖励下使用 GRPO 对 DeepSeek-R1-8B 在四个 H100 GPU 上进行了 189 个步骤的微调。在平衡的 200 个真/200 个假保留分割中,平衡准确度从 29.50% 上升到 63.75%,辨别差距——将错误陈述称为错误的比率与将真实陈述称为错误的比率之间的差异从 -0.5% (z=-0.1) 移动到 +27.5% (z=+6.0)。重要的是,这种增益并不是用一般的数学能力来换取的:在官方语义下,AIME 2026 的准确率为 65.00%,而基础数据为 69.17%,-4.17% 的差异在统计上并不显着,而早期在较小的 GraphSynth 语料库上运行相同的配方则崩溃至 40.00%。中位数响应长度也从 19,217 个词元下降到 18,296 个词元,截断率从 25.8% 下降到 8.3%,因此改进并不是来自思考时间更长。我们报告了结果以及限制其解释的混杂因素,主要是官方评估集的全错误组成以及现实错误普遍性所暗示的低精度。