论文

表面成功与内部崩溃:自适应多智能体系统泛化的实证研究

Superficial Success vs. Internal Breakdown: An Empirical Study of Generalization in Adaptive Multi-Agent Systems

智能体系统Agent任务评测

摘要

自适应多智能体系统(MAS)越来越多地被用来解决复杂的问题。然而,其优化的任务覆盖范围狭窄引发了它们是否可以作为通用系统运行的问题。为了解决这一差距,我们对自适应 MAS 进行了广泛的实证研究,揭示了两个关键发现:(1)拓扑过度拟合——它们无法在不同领域进行泛化; (2) 虚幻的协调——它们实现了合理的表面精度,而底层代理交互却偏离了理想的 MAS 行为,引发了人们对其实际效用的担忧。这些发现凸显了在 MAS 开发中优先考虑泛化的迫切需要,并激发评估协议超越简单的最终答案正确性。