论文

答案正确、方法错误:科学基准中的推理捷径

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

模型评测模型行为与机制分析

摘要

科学推理基准通常使用最终答案准确度来评估大语言模型(LLMs)。然而,正确的答案并不一定表明问题所针对的推理能力。我们识别出一种失败模式,即LLM通过无效的捷径,如数值搜索、枚举、猜测或答案先验验证,达到正确的答案,但没有提供有效的任务导向的推导。我们系统地分析了这一现象在不同难度、科学领域和前沿模型上的表现。随着基准难度的增加,Solution Hacking(Solution Hacking)的比率从常见的问题中的2.2%增加到奥林匹克问题中的28.3%和HLE中的37.4%。此外,8.2%到44.1%的正确答案被识别为Hack Solution(Hack Solution)。我们进一步开发了专家启发式的抗Hack策略,包括自动判分器和测试时间指令。结果表明,抑制捷径行为显著减少了报告的准确度,但对正确和未Hack的准确度影响较小。这些发现揭示了仅基于答案的评估可能会高估前沿LLMs的科学推理能力。

答案正确、方法错误:科学基准中的推理捷径:论文配图
图 1:同一二次方程问题的三种求解路径。上面的路径代表了预期的推理过程,在这个过程中LLM锻炼了有针对性的推理能力并得出正确答案。中间路径代表推理错误,无效的推导会导致错误的答案。下面的路径代表Solution Hacking,大语言模型通过枚举、猜测、搜索或答案优先验证来获得正确答案,而无需完成目标推导。传统的评估可以区分上路径和中路径,但可能无法区分上路径和下路径,因为两者都会产生正确的最终答案。