论文

超越共识:Mixture of Agents中的轨迹级合成

Beyond Consensus: Trace-Level Synthesis in Mixture of Agents

模型推理推理验证与自校正

摘要

当多个LLM智能体解决同一问题时,标准做法是将各智能体的推理压缩为多数投票或分层合成,把达成一致视为终点。我们证明这种做法造成了不必要的损失:读取完整推理轨迹的LLM聚合器即使在所有智能体一致同意时也能恢复出正确解,且有益修正持续多于有害修正——这就是聚合悖论(aggregation paradox)。多数投票存在一个上限,扰动多样性并不能抬高这一上限(误差相关性完全相同);聚合器的收益来自轨迹级互补性,即从被投票丢弃的少数链中组装出正确的中间步骤。这些发现促成了Self-Consistent Mixture of Agents:它通过保语义的输入扰动生成轨迹多样性,借助带可证非退化保证的锚定精炼来保护多数意见,并且总是进行合成——绝不以共识作为门控条件。单个模型借助扰动诱发的轨迹变化,在结构化推理、博士级科学、竞赛数学和程序设计竞赛上均优于异构模型池。聚合的基本单位应当是推理轨迹,而不是答案。

超越共识:Mixture of Agents中的轨迹级合成:论文配图
图 8:所有五个条件的管道热图(每个条件 n=171n{=}171)。单元格按标准化等级按列着色(绿色=最好,红色=最差)。粗边框凸显了两种竞争条件。尽管达成了合理的共识,4persona@70B 和 @8B 的准确性还是崩溃了。 4persona@20B† 在严重的 TPM 限制下运行(0.8 个 LLM 调用/问题);它的 SC 自退出和无聚合指标反映了不完整的管道执行而不是算法行为。