论文

答案并不等于论证

The Answer Is Not the Argument

模型评测模型能力评测

摘要

人工智能监督提出了思想链监控,但评估通常为监控者提供可信的参考答案。我们询问答案访问是否改善了推理验证或主要暴露了错误的结论。我们从三个前沿模型中收集了 79 道人类期末考试物理题的 237 个步骤编号答案,没有插入错误,并独立标记了最终答案的正确性和第一个错误步骤。参考标准结合了物理学家的注释、独立的LLM辩论和来源屏蔽的裁决。这产生了 24 条关键痕迹,其中答案是正确的,但痕迹包含真正的错误。 8 名LLM监督员以未经验证或认证的答案或在盲目承诺后盲目评估痕迹。认证将平均平衡精度从 0.637 提高到 0.796,而精确的首次错误定位从 0.261 提高到 0.379。认证将错误答案跟踪的召回率(标记为错误的错误跟踪的比例)从 0.653 更改为 0.951,而将关键跟踪的召回率从 0.521 更改为 0.438;所有 8 个监视器的对比度方向相同(问题引导 95% CI [+0.256,+0.506])。盲目承诺后,监视器显示的答案新将 93.8% 的先前通过的错误答案跟踪标记为错误,但只有 18.0% 的关键跟踪。因此,答案访问改进了结论一致性检查,而不是对支持论点的独立验证。对于人工智能安全而言,这些痕迹提供了奖励黑客的良性模拟:可接受的输出并不能证明产生它的过程是健全的。尽管这里研究的错误是普通的,并且大多是非承载性的,而不是对抗性的,但当可接受的输出掩盖了不合理的推理时,可信答案评估可能同样夸大了监控能力。

答案并不等于论证:论文配图
图1:研究设计。人类最后考试的物理问题被过滤到那些只有文本、精确匹配和真正多步的问题,在跨线试验和标签阶段排除之后只剩下79个。三种边界模型每个问题产生一个编号的解决方案。物理学家的注解臂和独立的五轮大语言模型辩论臂被源头式裁决合并到参考标准中,8名监测员在6个条件下接受评估。