论文

稳健推理基准

Robust Reasoning Benchmark

模型评测鲁棒性、公平性与可信度评测

摘要

虽然 大语言模型 (LLM) 在标准数学基准上取得了高性能,但它们解决问题的能力取决于上下文和文本格式。我们引入了鲁棒推理基准 (RRB),这是应用于 AIME 2024 和 AIME 2025 的 13 个确定性文本扰动的管道。评估 8 个最先进的模型,我们发现前沿模型在很大程度上具有弹性,但 Claude 是一个明显的例外,它断然拒绝了许多转换的提示。开放权重推理模型在结构噪声下表现出一系列故障模式(认知颠簸、标记化崩溃和推理崩溃),在扰动下平均准确率下降高达 54%,在某些扰动下高达 100%。我们进一步单独研究其中一种失败模式:模型自身思维链引起的注意力稀释。通过让模型在单个上下文窗口内顺序解决多个独立的数学问题,我们识别了查询内注意力稀释。参数范围从 7B 到 120B 的开放权重模型在后续问题上表现出准确性下降,这表明中间推理步骤逐渐污染标准的密集注意力机制。我们认为,为了实现可靠的推理,未来的架构需要将显式的上下文重置集成到模型自己的思维链中,从而引发有关推理任务的最佳粒度的开放研究问题。