论文
大语言模型中的信息辨别力
Information Discernment in Large Language Models
摘要
LLM日益与互联网等外部知识源配合使用。它们是否恰当地权衡信息——为可靠来源更新更多(来源辨别),并在论断使先验更接近真相时更新更多(真相辨别)?我们将其形式化为信息辨别力,并提出Learn2Discern(L2D):一个扎根于三条规范公理、带可解释指标的实验框架与基准。为确立外部效度,一项预注册、配额匹配的用户研究(n=299)确认真实LLM用户认可全部三条公理,并报告违规降低其信任与使用意愿。跨13个模型、近67万次试验,我们发现两个维度上的一致失败:模型在来源与真相辨别上接近随机,对来源流行度的依赖是对来源可靠性依赖的两倍;无论论断改善还是恶化其相对真值的处境,模型更新幅度大致相同。模型在先验本已最准的数据集上整合外部知识最有效。更新、更大的模型改善真相辨别但不改善来源辨别——这是模型复杂性无法解决的盲区。我们识别出能同时改善两类辨别力的简单推理时干预。我们发布数据集与调查,作为LLM取代传统搜索之际重要性随之上升的一个核心对齐性质的试验台。
