论文

CoT-Pass@k 真的检查 CoT 吗?多语言数学审计

Does CoT-Pass@k Really Check the CoT? A Multilingual Mathematical Audit

模型评测评测方法与指标

摘要

Pass@k 衡量模型在重复采样下是否得出正确答案,而不是如何得出正确答案:幸运的猜测与合理的推理相同。 CoT-Pass@k 旨在缩小这一差距,增加一名LLM作为评审,必须在解决方案的推理链发挥作用之前对其进行评估。它的价值完全取决于一个假设:评审发现有缺陷的推理。尽管该度量的声明涉及许多语言中使用的模型,但该假设从未在依赖于它的度量内部进行过测试,也从未在英语之外进行过测试。我们报告了对该验证步骤的第一次审计,该审计是在度量标准自己的协议下运行的,该多语言套件由英语、土耳其语和葡萄牙语的五个数学基准组成,其中两个是本地编写的。我们通过确定性编辑破坏了正确的解决方案,这些编辑分别损坏了链和最终答案。我们观察到,所有三位评审都接受腐败的链条,几乎与接受干净的链条一样频繁。 V4-Flash和Qwen3.6仅在最终答案错误时才强烈拒绝解决方案,而当链同意错误答案时更容易接受;该指标自己的判断也接受大多数错误的答案。我们的研究表明,链式答案一致性主导了两位较大评审的裁决,并且所有三位评审都未能可靠地检测出经过测试的推理错误。因此,在早期求解器一代上,Pass@k - CoT-Pass@k 的平均差异为 19.7 点,但在当前求解器上仅为 4.1 点。剩下多少取决于双方的词元预算和生成模式;提高发电预算使 Pass@64 提高了 50 个多点,而差异保持为零。我们以两项检查作为结束,任何判断的推理指标在其数字被解读为推理证据之前都应该通过。