论文

LLM 推荐者知道自己何时出现幻觉吗?审核目录 忠实性 中的置信度校准

Do LLM Recommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness

模型评测鲁棒性、公平性与可信度评测

摘要

用于 top-K 项目建议的 LLM 推荐器会定期发出目标目录之外的标题。之前的审计报告了二进制域外率;没有人问模型是否知道。我们联合审核来自四个独立供应商(Mistral Large、Llama-3.3-70B、GPT-OSS-120B、Claude Sonnet 4.6)的四个零样本 LLM 推荐器的幻觉率(OOD@10)和言语置信度校准(ECE、Brier、可靠性),这些推荐器未接入目录依据或经过微调的系统,跨越三个目录(MovieLens-25M、Amazon)评论 2023 年玩具,Yelp 开放数据集),按商品受欢迎程度分层。测量目录成员资格本身就是困难的部分:在相同的输出上,使用字符串匹配器报告的速率会移动一个数量级,并且 F1 无法区分候选者。我们根据 201 项人类判断来验证该工具,并根据净偏差进行选择,其中所采用的偏差与常见模糊规则的 +0.144 相比为 -0.040。幻觉强烈依赖于目录(MovieLens 上为 0.6-2.7%,Yelp 上为 11.6-38.7%,Amazon Toys 上为 49.3-61.0%)。每个模型都拥有几乎恒定的置信水平,几乎不响应目录,而目录命中率波动 60 个点,因此误差的符号由模型常数与目录准确性的关系决定:12 个单元格中的 7 个单元格信心不足,5 个单元格过度自信,所有 4 个单元格对 MovieLens 信心不足,所有 4 个单元格对 Amazon Toys 信心过度。我们将此解读为引发不匹配:“Just Ask”引发通用质量评级,而不是目录成员概率。超过言语置信度的适形弃权阈值在四个 alpha 水平上最多可将幻觉改变 1.65 pp,因为通道无法将正确的项目与幻觉区分开。我们建议审计报告校准与 OOD 一起进行,验证生成 OOD 编号的匹配器,并使用目录锚定的启发。