论文

多跳 QA 中的故障模式:最弱链接定律和识别瓶颈

Failure Modes in Multi-Hop QA: The Weakest Link Law and the Recognition Bottleneck

模型评测模型行为与机制分析

摘要

尽管扩展到巨大的上下文窗口,大语言模型(LLM)由于固有的位置偏差而难以进行多跳推理,这导致它们忽略某些位置的信息。这些失败是否源于无法找到证据(识别失败)或整合证据(合成失败)尚不清楚。我们引入了多焦点注意力指令(MFAI),这是一种语义探针,通过明确地将注意力转向选定的位置来理清这些机制。在两个多跳 QA 任务(MuSiQue 和 NeoQA)上的 5 个大语言模型中,我们建立了“最弱链接定律”:多跳推理性能崩溃到最不可见证据的性能水平。至关重要的是,这种失败是由绝对位置决定的,而不是事实之间的线性距离(性能方差 $<3%$)。我们进一步确定了注意力转向的二元性:虽然匹配的 MFAI 解决了识别瓶颈,在低可见度位置将准确性提高了 11.5%,但误导性的 MFAI 会在现实任务中引发混乱,但在合成任务中被成功过滤。最后,我们证明了利用 System-2 推理的“思考”模型,可以有效地定位和集成所需的信息,即使在嘈杂的长上下文环境中也能匹配纯黄金基线。

多跳问答中的失效模式:最弱链接效应与识别瓶颈
(c) 逐层热力图。