论文
超越多数投票:具有径向共识分数的高效 Best-Of-N
Beyond Majority Voting: Efficient Best-Of-N with Radial Consensus Score
摘要
大语言模型 (LLM) 经常针对给定的提示生成多个候选响应,但选择最可靠的一个仍然具有挑战性,特别是当正确性偏离表面多数协议时。现有的方法(例如自我一致性)依赖于离散投票,而基于概率的方法通常无法捕获候选答案之间的关系,或者往往会低估高质量但频率较低的响应,并且没有充分利用答案表示的几何结构。为了解决这些限制,我们引入了径向一致性评分(RCS),这是一种简单、高效的 无需训练 方法,用于 N 中最佳选择。 RCS 通过计算答案嵌入的加权 Fréchet 均值(语义中心)并根据候选者到该中心的径向距离对候选者进行排名来建模语义共识。重要的是,RCS 提供了一个支持多种加权方案的通用框架,包括统一、基于频率和基于概率的变体,从而能够灵活集成协议信号和模型置信度,同时保持完全适用于黑盒设置。涵盖短格式 QA 和长格式推理任务的七个基准以及五个开放权重模型的广泛实验表明,RCS 变体始终优于强大的基线,并且随着采样预算的增加,收益变得更加明显。 RCS 还可以作为多智能体辩论中多数投票的有效替代方案,并在黑盒场景中表现出强大的鲁棒性。总体而言,这些结果强调了几何共识是一种可扩展且广泛适用的可靠答案选择原则,超越多数投票,扩展到 LLM 推理中更具表现力和稳健的聚合。