论文

数据伪迹未必是捷径:合成RLVR语料库的因果审计

When a Data Artifact Isn't a Shortcut: Causal Auditing of Synthetic RLVR Corpora

模型评测评测方法与指标

摘要

最近的几个管道通过屏蔽一段真实的语料库文本并要求语言模型围绕它发明看似合理的错误答案来构建 RLVR 训练数据。因此,正确的选择是真正的人类撰写的文本;每个干扰选项都是合成的。正确性和出处变得纠缠在一起,原则上策略可能学习来源而非正确性。我们在 GooseReason-0.7M 中审核了这种可能性。首先,我们询问不对称性是否明显:仅读取 5 个表面统计数据(不读取语义)的分类器在 315,499 个选项中达到 AUROC 0.562,仅略高于随机水平。不过,总体来看,隐藏着一些东西。代码的得分为 0.416,低于随机水平,手动检查解释了原因:代码干扰因素原来是正确答案的单操作符突变,而不是自由编写的替代方案,因此这两个类的结构几乎相同。检测信号与显示模型使用信号不同,因此我们随后进行干预。我们建立了一个释义匹配的控制语料库,保持训练集大小相同,并在一个固定预算下训练两项策略。伪迹利用差距并未偏向未经修改的数据组:该组为0.021,对照组为0.027。换句话说,在我们的预算下,可检测的数据伪迹并未被利用。我们认为分离以及特定领域的构造发现对于任何管理此类语料库的人来说都是值得了解的,并且我们将审计作为主要仅适用于 CPU 的协议发布。