论文
位置诅咒:LLM 努力找到列表中的最后几项
The Position Curse: LLMs Struggle to Locate the Last Few Items in a List
摘要
现代 大语言模型 (LLM) 可以大海捞针(找到隐藏在数十万个不相关标记中的单个相关事实),精度接近饱和,但无法检索短列表中的最后几项。我们将这种失败称为“位置诅咒”。例如,即使在两行代码片段中,Claude Opus 4.6 大多数时候也会错误识别倒数第二行。为了描述这种失败的特征,我们评估了两个互补的查询:给定序列(字母或单词)中的位置,检索相应的项目;并给定一个项目,返回其位置。每个位置都被指定为距锚点的向前或向后偏移量,锚点可以是列表的端点(其开始或结束)或列表中的另一个项目。在开源和前沿闭源模型中,后向检索大大落后于前向检索。为了测试后训练是否可以挽救这种能力,我们构建了PosBench,一个以位置为中心的训练数据集。 LoRA 微调 改进了前向和后向检索,并推广到保留的代码理解基准 (PyIndex),但绝对性能仍远未达到饱和。随着 LLM 编码智能体 越来越多地在大型代码库上运行,其中精确索引对于代码理解和编辑至关重要,基于位置的检索成为未来预训练目标和模型设计的关键功能。