论文

多专家共形风险控制,在开放式对话中进行配对 LLM 判断

Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue

模型评测评测方法与指标

摘要

在本文中,我们探索了开放式对话中成对 LLM-as-a-Judge 评估的多专家共形风险控制 (CRC) 算法。我们的核心见解是,多专家聚合为 CRC 提供了补充补救措施:CRC 通过弃权来控制决策阈值的风险,而聚合则从源头净化了评分函数。以此为指导,我们首先设计了两种多专家CRC方法:分数平均和决策投票,分别在分数和决策级别进行聚合。虽然这两种策略在同类专家小组中都优于单专家方法,但在异构 LLM 法官中,它们仍然具有风险有效性,但只能恢复有限的覆盖范围,因为统一的阈值无法匹配专家的不同评分标准。为了解决这个问题,我们进一步提出边际校准共形共识(MC3):它通过初始阈值比率捕获不同的每个专家尺度,同时联合调整在校准和测试中相同应用的统一决策函数 $C_t(x)$,从而保持可交换性。为了评估我们的框架,我们构建了 Panel,这是一个用于开放式对话的 1,800 对人类成对偏好基准。它基于四个开放权重 LLM 在来自三个域(ESConv、MSC、DREAM)的对话上下文中生成的响应,具有完整的 logits 访问权限。在实验中,我们发现平均分和决策投票都大大提高了同质小组的准确性和接受率。值得注意的是,MC3 通过在所有三个数据集上容纳不同的每位专家评分量表,将这些收益扩展到异构面板。