论文

委派何时胜过多数投票?面向多智能体推理的基于委派的聚合器

When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference

模型推理推理验证与自校正

摘要

多数投票是多样本 LLM 推理的默认无监督聚合器,但它丢弃了两个信号:组内答案熵和组间推理几何。我们通过委托进行聚合(传播代理投票,PPV):每组样本根据其基于熵的置信度(何时)按比例对自己的答案进行权重,并通过推理嵌入相似性(谁)将其余样本路由到同行;生成的委托矩阵的平稳分布选择一致的答案。这既不需要金标签,也不需要训练。在每个问题有 128 个样本的 MMLU-Pro 上,代表团总体上以 +1.5 个百分点击败多数派,在重要问题上以 +2.24 个百分点击败多数派(McNemar p ~ 1.0e-14,n = 8,099),推翻了错误的多数派,其答案簇在几何上不连贯,而正确的少数派则很紧。然后,我们准确描述授权推翻多数的情况:两个选项模型针对每个选项的置信度及其传递给另一个选项的权重给出了封闭形式的翻转条件,对于几乎一致的问题给出了无害的​​推论。该条件在 96.5% 的重要问题上称为已实现的获胜者,并且其预测的质量间隙跟踪 r = 0.97 处的已实现间隙。我们没有发现任何其他无监督集成方法可以缩小预言机的差距。

委派何时胜过多数投票?面向多智能体推理的基于委派的聚合器:论文配图
图 1:来自问题 Philosophy_314 的直接投票和委托的简化网络。每个机器人都是一个投票者(一组 LLM 样本)。它对自己的答复信保留一定的权重,并将其余的部分发送给推理嵌入一致的同行。完整图表有 1616 个投票者,大多数人选择了错误的字母 1010 到 66;为了便于阅读,我们画了 55 个(33 个多数 + 22 个少数)。一个连贯的少数群体加上一个背叛的多数选民(v9v_{9})吸收足够的重定向质量来推翻共识。绿色字母I代表PPV选择的金色答案;红色的D是大多数人集体选错的字母。