论文

迷失于噪声:推理模型如何败于上下文干扰

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

模型评测上下文与知识上下文工程基准与评测资源

摘要

推理模型与agentic AI系统的最新进展使模型日益依赖多样化的外部信息。然而,这种转变引入了天然含噪的输入上下文,而当前“净化”的基准无法反映这一现实。我们提出NoisyBench,一个综合基准,系统评估模型在RAG、推理、对齐与工具使用任务的11个数据集上,面对随机文档、无关聊天历史与困难负例干扰等多样噪声类型时的鲁棒性。我们的评测揭示,面对上下文干扰时,最先进模型的性能出现高达80%的灾难性下降。关键的是,我们发现agentic工作流常因过度信任带噪工具输出而放大这些错误,且干扰项即使在没有对抗意图的情况下也能触发涌现性错位(emergent misalignment)。我们发现提示工程、上下文工程、SFT与仅用结果奖励的RL都无法保证鲁棒性;相比之下,我们提出的Rationale-Aware Reward(RARE)通过激励模型在噪声中识别有用信息,显著增强了韧性。最后,我们发现一条逆向缩放趋势:测试时计算越多,含噪环境下的性能越差;并通过注意力可视化证明模型不成比例地聚焦于干扰token,为构建下一代鲁棒、具备推理能力的代理提供了重要洞见。

迷失于噪声:推理模型如何败于上下文干扰
图1:干净基准与 NoisyBench 的对比,表明模型在经过消毒处理的设置中表现良好,但在来自随机文档、无关聊天历史和困难负例干扰项的现实噪声下会失败,这揭示了对齐、推理和 RAG 鲁棒性方面的弱点。