论文

准确性隐藏了语言模型失败的原因:在匹配的输出预算下衡量失败状态

Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

模型评测评测方法与指标

摘要

语言模型基准将两个不同的测量问题合并为一个准确性分数:响应是否达到可评估状态,以及其答案是否被判断为正确。我们引入了一个两层评估框架,将独立于评分者的执行证据(包括终止、答案暴露、可解析性和完成长度)与依赖于评分者的正确性分开。在 MATH 和 ARC-Challenge 上五个固定 Qwen 和 DeepSeek 配置的 2,550 个输出中,匹配的 2,048 个词元限制会产生截然不同的执行混合:450 个 Qwen MATH 输出中的 49 个在没有最终答案的情况下终止,而 300 个 DeepSeek MATH 输出中只有 5 个输出,750 个 ARC 输出中没有一个输出。在相同的 300 个 DeepSeek MATH 问题模型对中,在 8,192 个标记处没有观察到缺失最终长度终止。一项覆盖范围审核的有针对性的验证研究进一步表明,候选人选择和汇总政策可以大大改变相对准确性估计。这些结果表明,准确性将执行案例组合与验证策略混为一谈。因此,对测试时方法的评估应报告干预前的执行状态、验证覆盖率、评分者来源以及准确性。