论文

整合打破了共形预测

Conformity Breaks Conformal Prediction

模型评测鲁棒性、公平性与可信度评测

摘要

当 LLM 单独回答时,共形证书可以是有效的,而当同一个 LLM 看到一致断言错误答案的对等体时,共形证书可以是无效的。问题没有改变;模型的正确答案得分发生变化。我们称之为评分机制转变:干净的校准证明模型如何单独对答案进行评分,而不是在同伴压力下如何对答案进行评分。我们证明这种转变悄然打破了多智能体 LLM 系统中的保形预测。在开放权重模型和多项选择 QA 任务中,在标准 alpha = 0.10 操作点下,在一致错误的同行情况下,覆盖率从校准的 90% 下降到 74%。平均值隐藏了一个更严重的失败:通过针对证书仍然覆盖的低置信度项目,攻击者几乎将该子组的覆盖率减半,从 87% 到 47%,而监控的平均值仍然要高得多。失败还会到达决策层:一个在不确定时应该升级的系统反而可以变得足够自信,对攻击者的错误答案采取行动。标准的保形修复不能解决问题,因为问题分布没有改变;模型的评分行为有。