论文

SciCode 验证:基准缺陷如何低估语言模型的科学编码能力

SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

模型评测基准与评测资源

摘要

SciCode 是衡量语言模型科学编码能力的标准:研究级问题需要前沿科学理论及其作为工作数字代码的实现。它是人工智能分析指数的组成部分,也是政府和国家实验室套件的长期评估。然而,其得分最近已趋于稳定:最强的 2026 个模型紧密围绕 60% 的子问题准确率,而后继模型与前任模型持平。我们将这种停滞归因于基准测试本身的缺陷。对所有 65 个测试问题进行的每个问题的领域专家审核发现了 263 个缺陷;其中 192 个问题涵盖了 91% 的主要问题,导致正确的、遵循说明的解决方案被错误地拒绝——因为不可重复的标准答案、过紧的容差或自相矛盾的规范。至关重要的是,这些抑制分数的缺陷中有 78% 需要专门的物理或数学知识来检测,而不仅仅是文书校对。我们纠正了所有可确认的缺陷,以生产经过 SciCode 验证的产品。修正仅增加了适定问题所需的规范,修复了分级,并收紧了过于宽松的测试;每项更改都会记录其合理性,并由第二位领域专家独立重新检查。我们在修正后的基准上重新评估了 12 个前沿模型快照,发现了显着的恢复:子问题准确率从 45--60\% 上升到 84--98\%,主问题准确率从 9--27\% 上升到 69--92\%。最先进的模型在科学编码方面比 SciCode 所暗示的要熟练得多——​​瓶颈不是模型能力,而是评估工具的质量。我们发布了 SciCode-Verified 及其完整的审核跟踪作为更正的公共标准。