论文
通过结构化专家判断对多 LLM 系统进行不确定性感知信任估计
Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement
摘要
大语言模型 (LLM) 集成越来越多地用于通过组合多个 LLM 的预测来提高可靠性。然而,现有的聚合方法通常假设所有模型都同样值得信赖,而忽略了不确定性质量的差异。这种假设不太适合异构 LLM,其可靠性和能力差异很大,使得简单的聚合很容易受到不可靠或敌对专家的攻击。在这项工作中,我们将多 LLM 聚合制定为不确定性感知信任估计问题。我们采用决策理论中的结构化专家判断,使用上下文感知校准问题根据概率预测的质量来估计专家的可靠性。具体来说,我们采用库克式的对数加权,它会惩罚过度自信的错误预测,并有利于经过良好校准的专家。我们在同质、异质和污染的专家小组中评估了我们在 MMLU 和 MMLU-Pro 上的方法。结果表明,虽然聚合方法在同质环境中表现相似,但库克加权在异质性和污染情况下变得至关重要。它实现了卓越的准确性-可靠性平衡,并且在引入不可靠的专家时仍然保持稳健。这些发现表明,Multi-LLM 聚合不仅需要组合预测,还需要在不确定性下校准信任。