论文
当LLM意见一致时它们是对的吗:审计自一致性与跨模型一致性作为置信信号
When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
摘要
LLM即裁判日益成为企业管线评估AI系统的默认——常扩展为集成或裁判的“专家混合”面板。这些系统共享一个关键假设:一致性——裁判之间或模型自身样本之间的一致——指示正确性。我们显示该假设不可靠。一致性不是准确率:模型可以与自己一致、不同模型可以彼此一致——出于共享偏置、记忆的启发式或选项位置先验而非真相。我们追问一致性何时仍是可用的代理:大规模跨运行者研究——53个运行者为分配的重叠案例抽取K=50样本,横跨GPQA Diamond与AIME上的模型层级、提示与规模比较——26.5万样本。以多数正确为部署标签、分层运行者聚类自助:一致性是正向但弱的预测因子(ρ 0.20–0.59,项聚类重采样下全部为正),其有用性依赖regime:对未饱和的中档模型与算力分配最佳,而对最一致的前沿模型最差——过度自信却不再准确(GPQA案例结果条目的77%一致性≥0.8,其中48%错误)。三个Claude层级的探索性跨家族检查显示同样的前沿过度自信:自信的错误跨供应商复现、高于保边际零假设。自一致性因此是正确性的条件代理,而非独立的置信分数。我们公开发布去标识的逐运行行与答案分布。