论文

长上下文 LLM 中的位置失败:推理基准中的盲点

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

模型评测基准与评测资源

摘要

位置控制评估是大海捞针和标尺等检索任务的标准,但主流推理基准不控制目标任务在长上下文中的位置放置。我们审核了 11 个长上下文基准,发现没有一个基准可以共同控制任务位置、填充内容和推理的上下文长度。对四个旗舰长上下文版本的审计发现,NIAH、RULER 或 LongBench 系列基准测试没有主要结果表条目,而代理和编码基准测试则出现在所有四个的主要结果表中。我们提出了上下文旋转评估(CRE),这是一个改变所有三个因素的受控框架,并在两轮中评估 GSM8K 和 ARC-Challenge 上的 9 个 LLM:初始的五个模型集和四个较新的供应商版本。当目标任务从末端移动到中间时,模型可能会急剧下降,并且随着易受攻击模型的上下文长度的增加,下降会变得更严重。在 with_solutions 填充下,MiMo-v2-Flash 在 64K 下下降了 88pp(中间精度 8%)。较新的版本显示出较小的下降:在 64K 时,四分之三保持在终端位置精度 +/-6pp 之内; MiMo-V2.5-Pro 将 MiMo-v2-Flash 的下降幅度从 88pp 缩小至 32pp。在 questions_only_v2 填充下,中间位置的下降在所有四个中都持续存在(在 8K、32K、64K 上范围为 -16pp 到 -56pp)。在 8K 时,在最后添加目标任务副本的诊断探针在所有九种模型中带来了在最终基线 +/-4pp 范围内的中等精度,这与位置解释一致。在最初的五模型集中,76% 的中间位置错误与周围的填充文本匹配,而在末端位置只有 22%,这与填充答案干扰作为主要错误模式一致。这些结果暴露了当前推理基准设计和供应商评估实践中的结构性评估差距:当任务位置不受控制时,无法测量随着上下文长度而增长的位置漏洞。