论文

Credal大语言模型:用概率集合衡量不确定性与语义确信

Credal Large Language Models for Semantic Commitment under Uncertainty

模型评测评测方法与指标

摘要

大语言模型常过度自信地输出流畅但错误的答案。标准模型用单一预测分布表示不确定性,容易混淆知识不足与真实歧义。Credal大语言模型CLLM用LoRA适配器集合构造概率分布集合(credal set),以概率上下界揭示合理预测分布之间的差异,而非压缩为单一softmax输出。由此得到两个互补的确信分数:词元确信度CTC结合概率下界支持、概率集合宽度与交集熵,无需额外生成;语义确信一致性SCC使用采样答案,SCC-Gap衡量词元与语义支持之间的差距。研究在Gemma-2-9B、Llama-3.1-8B和Qwen2.5-7B及四项问答基准上评估幻觉检测、校准、选择性预测和推理。CLLM取得最高问答准确率,预期校准误差有竞争力;多数设置下,CTC的幻觉检测AUROC与最佳方法相差不超过1.5个百分点。80%覆盖率的选择性预测中,CLLM配合SCC在OpenBookQA上达到99.0%准确率,配合Csem置信度在ARC-Challenge三种基础模型上均达到不超过0.6%的预期校准误差。