论文
锚定虚构:部分证据非单调放大 LLM 中的自信幻觉
Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs
摘要
我们确定了 大语言模型 的一个先前未知的校准属性:在充分证据消除模型之前,向多步骤推理链提供一个已确认的中间事实会增加模型的置信错误答案率。我们称之为锚定组合:部分锚定使模型能够自信地参数完成剩余的推理步骤。我们将其形式化为参数幻觉置信度 (PHC),并通过六组证据建立它,包括因果注入实验(PHC 0.613 至 0.656 至 0.595 至 0.536,N=160)和跨五个模型系列的能力缩放(Spearman rho=0.900,p=0.037)。锚定阈值定律 k*(n)=floor(n/3) 通过跳跃深度预测 PHC 扩增,并有四个已确认的预测。应用于 RAG 路由时,利用 PHC 的 LearnedRouter 在四个基准测试中的 1,800 个查询中缩小了 81.1% 的预言机性能差距(宏 F1=0.426,p<1e-6),没有模型 微调,并且标签比之前基于 RL 的工作少了 50 倍。认知谦逊提示将 PHC 峰值降低 -0.118;显式自评(PHC=0.684,p<0.001)作为路由信号优于词汇置信度。