论文

RAIM:用于幻觉检测的廉价模型的稳健聚合

RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

模型评测评测方法与指标

摘要

忠诚度的自动评估越来越依赖于充当评审的大语言模型,但最可靠的评审是专有的前沿模型,成本高昂且不适合高吞吐量监控。我们研究是否可以聚集一组廉价的开放权重评审(4--9B)来代替前沿评审,替代品会牺牲什么,以及何时值得做出牺牲。我们提出了 RAIM,一种对成员相关错误具有鲁棒性的聚合方案,将交叉拟合的堆叠逻辑回归与可接受性测试相结合,该测试从成员自己的输出中读取,确定聚合时它们对最佳成员的改进,并保持在前沿评审的范围内。我们用来自不相交家庭的 10 名评审来实例化 RAIM,跨越八个忠诚度基准。与 Claude Sonnet 相比,该小组保留了 Cohen $κ$ 的中位数 93%,平均仅放弃 2.9 分的平衡准确度;从成对差异的角度来看,它在一个基准上明显有所改善,在三个基准上明显恶化(只有两个基准的差距不可忽略),而四个基准尚未解决。按照前沿推断价格的六十四分之一,操作费用是对 50--100 个标记记录进行一次性域内校准。该面板在其家庭基准测试中也与专门训练的检测器具有竞争力(在 GPT-4o 的 1.3 精度点内,在 LLM-AggreFact 领先者的 1.9 点内),并且在我们的grounding集上击败了我们重新运行的最强检测器 6 点。聚合是否有利取决于成员本身:当几个有能力的成员在不同的项目上犯错时,小组会改进其最佳判断并接近边界;当一方占主导地位时,堆叠者就会恢复领先者,只有在那里,前沿才能保持实质性领先。这两种条件都可以从校准设置中读取,无需额外成本,因此无论审计是否认可,廉价的面板都可以代替前沿面板。