论文

超越对称智能体:小语言模型中的认知多样性和多智能体争论

Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models

智能体系统Agent 协作

摘要

据报道,多智能体辩论(MAD)比单模型推理提高了推理能力和事实性,但之前的工作将智能体视为对称对等体,而对推动收益的因素却持开放态度。我们测试了这样一个假设:Agent之间的认知多样性是驱动因素,在问题仍然可衡量的环境中:具有基准净空的小型开放权重模型。在来自 11 个供应商系列的 23 个模型、5 个任务以及 5,500 多次辩论和控制运行中,我们沿着三个轴(角色、采样温度和模型身份)改变多样性,将每个辩论配置与一代预算匹配的多数投票控制配对。该假设在每个轴上都被拒绝。辩论击败了单智能体推理(任务有空间的情况下为 3--7 分),但在匹配的预算条件下,它与自一致性采样持平甚至失败,时钟成本为 1.6$\times$,词元成本为 3.4$\times$。角色提示会降低准确性,并且对每个模型的完整组合角色空间进行的剂量反应实验表明,成本是角色税,而不是多样性税:冗余的角色伤害最大,而最大程度多样化的团队则弥补了部分损失。此外,混合模型团队在自己的名单上输给了多数票,准确地跟踪成员能力而不是异质性,并且几乎所有辩论的好处都来自第一次交换答案。我们进一步发现了一种普遍存在的测量风险,即辩论记录悄悄地溢出了服务上下文窗口,仅对其进行修正就可以将我们的辩论与抽样比较从 $-1.8$ 点移动到平价。我们的结果将报告的 MAD 收益重新定义为整体抽样效应,并提供了预算匹配、污染检查的基准线,未来的辩论机制应该需要清除这些基准线。