论文

BEACON:大语言模型 中跨模型幻觉检测的行为熵聚合

BEACON: Behavioral Entropy Aggregation for Cross-Model Hallucination Detection in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中的幻觉被定义为生成事实上不正确或不受支持的内容,仍然是可靠部署的关键障碍。我们提出了 BEACON(跨模型幻觉检测的行为熵聚合),这是一种黑盒幻觉检测框架,纯粹基于模型输出运行,无需访问内部表示或外部知识库。 BEACON 从结构化多遍生成中提取 31 维特征向量,集成基于 NLI 的语义熵、嵌入几何、思想链一致性和释义稳定性信号。在七个基准测试中的 7,617 个标记示例上训练的梯度增强分类器达到了 0.8123 +/- 0.0102 AUROC (95% CI: 0.7632-0.8251),优于独立语义熵 (+0.2298) 和 SelfCheckGPT 风格的一致性基线 (+0.2457)。特征重要性分析表明,幻觉本质上是多维的,需要组合的不确定性信号。高效的 5 次调用变体可实现 0.7795 AUROC,从而实现跨黑盒 LLM API 的实际部署。