论文
AlgBench:大推理模型在多大程度上理解算法?
AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?
摘要
推理能力已成为大型推理模型(LRM)发展的核心关注点。尽管在MATH500和LiveCodeBench等若干推理基准上已取得显著进展,但现有的算法推理基准仍然有限,无法回答一个关键问题:LRM是否真正掌握了算法推理?为回答这一问题,我们提出AlgBench,一个以算法为中心的范式来评测LRM的专家精心整理的基准。AlgBench包含3,000多道原创题目,覆盖27种算法,由ACM算法专家构建,并按照一个全面的分类体系组织,包括欧氏结构、非欧氏结构、非优化、局部优化、全局优化和启发式优化等类别。对领先LRM(如Gemini-3-Pro、DeepSeek-v3.2-Speciale和GPT-o3)的实证评测揭示了显著的性能异质性:尽管模型在非优化任务上表现良好(最高92%),但在动态规划等全局优化算法上的准确率骤降至约49%。进一步分析发现了策略性过度转移(strategic over-shifts),即模型因必要的低熵token而过早放弃正确的算法设计。这些发现暴露了以题目为中心的强化学习的根本局限,并凸显了稳健算法推理所需的以算法为中心的训练范式的必要性。
