论文
为什么没有检查?两个配备工具的语言模型中缺乏依据的最终断言及其修复
Why Didn't It Check? Unsupported Final Claims and Their Repair in Two Tool-Equipped Language Models
摘要
即使单个可用工具调用可以解决不确定性并且其指令明确禁止假设和猜测,能够访问工具的语言模型也可以做出不受其所见证据支持的最终主张。我们将这种失败分为两个精确定义的量:发生率,模型自己提出不受支持的主张的频率,根据可见证据和最终主张来衡量,而不使用隐藏的正确答案;和有条件修复,当提供缺失的证据时,修复那些相同的自然发生的不受支持的主张的频率。在一个固定的 Qwen3-32B 设置中,对 256 个新提示模板的 512 个首次响应中有 33 个以不受支持的既定声明结束。我们根据索赔发生州的精确副本重播每个案例;在每个匹配的重播中,替代工具响应具有相同的结构和长度,仅在单字符响应代码上有所不同。解决证据修复了 33 项索赔中的 33 项;不包含有用信息的匹配响应修复了 33 个中的 0 个。当证据支持原始答案时,模型保留了 33 个中的 33 个,没有观察到任何损害。在另一项实验中,在需要证据的 64 个案例中,自动检查规则添加了 21 个证据调用,纠正了所有 10 个错误且不受支持的说法,保留了 11 个偶然正确的答案,并且从未将正确答案更改为错误答案。在使用相同采样设置的固定 Gemma 4 设置中,模型在所有 512 个首次响应中调用该工具,并且从未做出不受支持的最终声明,因此无法测量该设置的条件修复。这些结果描述了两个综合任务系列的两个局部固定模型设置。它们没有显示这种失败在现实世界的部署中有多常见,也没有反映出跨模型共享的通用机制。