论文
答案正确、方法错误:科学基准中的推理捷径
Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
摘要
科学推理基准通常使用最终答案准确度来评估大语言模型(LLMs)。然而,正确的答案并不一定表明问题所针对的推理能力。我们识别出一种失败模式,即LLM通过无效的捷径,如数值搜索、枚举、猜测或答案先验验证,达到正确的答案,但没有提供有效的任务导向的推导。我们系统地分析了这一现象在不同难度、科学领域和前沿模型上的表现。随着基准难度的增加,Solution Hacking(Solution Hacking)的比率从常见的问题中的2.2%增加到奥林匹克问题中的28.3%和HLE中的37.4%。此外,8.2%到44.1%的正确答案被识别为Hack Solution(Hack Solution)。我们进一步开发了专家启发式的抗Hack策略,包括自动判分器和测试时间指令。结果表明,抑制捷径行为显著减少了报告的准确度,但对正确和未Hack的准确度影响较小。这些发现揭示了仅基于答案的评估可能会高估前沿LLMs的科学推理能力。
