论文

测试时通信扩展多 Agent 协作

Scaling Discovery through Test-Time Communication

智能体系统Agent 协作

摘要

科学的进步不是孤立的,而是通过合作实现的,但现有的代理系统却很少捕捉到这一点。沟通代理是否有帮助仍然是一个悬而未决的问题,之前的结果好坏参半。我们表明,在具有挑战性的任务上,测试时的沟通可以大大优于独立的并行尝试,在这些任务中,分享突破可以推动整个团队前进。我们首先在 ARC-AGI-3 上研究扩展多代理测试时通信的影响,其中代理没有预定义的角色并通过共享目录进行通信,ARC-AGI-3 是一个需要解决新问题的基准。我们发现,由 $k$ 沟通代理组成的团队 team@$k$ 与 $4k$ 独立代理的成功率相当,并且这种优势随着 $k$ 的增加而增长,这表明收益会随着规模的扩大而复合。其效果不仅仅是效率:单个智能体无法解决的任务,一组智能体可以可靠地解决。此外,如果有足够的计算,这些收益可以转移到以研究为导向的任务。在多骨牌包装上,通信代理的表现优于 best@$k$,并超过了之前的最著名分数。在 MNIST 分类器压缩中,通信超越了最著名的人类解决方案。由四名智能体组成的团队生成了 1,957 字节的分类器提交,测试准确率达到 99.4%,比最著名的人类解决方案和最佳单智能体结果都小。这些收益并不是无条件的。当计算有限或缺乏明确的进度衡量标准时,独立代理的性能可能会优于通信。然而,在足够的计算和清晰的反馈下,多智能体通信始终会产生更强的结果。