论文

多智能体编程中角色一致不代表任务解答正确

Understanding Conversational Patterns in Multi-agent Programming: A Case Study on Fibonacci Game Development

智能体系统Agent 协作

摘要

大语言模型 (LLM) 越来越多地应用于软件工程 (SE),但其自主、面向角色的协作的潜力在很大程度上仍未得到充分开发。了解多个基于 LLM 的代理如何协调、保持角色一致性以及汇聚解决方案对于 SE 至关重要,因为天真地允许代理进行交互并不能可靠地带来正确或稳定的结果。最近的实证研究表明,非结构化或知之甚少的交互动态可能会导致错误传播、对不正确的解决方案过早达成共识,或阻碍收敛的长期分歧,即使在交互的早期就存在正确的部分解决方案。作为解决这一尚未充分探索的领域的第一步,我们对两个代理(设计师和程序员)之间的对话进行了系统分析,涉及 7 个开源 LLM(Gemma 2、Gemma 3、LLaMA 3.2、LLaMA 3.3、DeepSeek-R1、MiniCPM 和 Qwen3)的 12 种模型组合。我们的系统方法揭示了多智能体交互的三个关键维度:效率(收敛的速度和稳定性)、一致性(BLEU 和 ROUGE 可视化的角色对齐程度)和有效性(编译成功和错误解决的程度)。结果表明,DeepSeek-R1:DeepSeek-R1 对在从第一次迭代开始收敛到正确的解决方案并将其始终保持到最终迭代方面具有独特性,而 LLaMA 3.2:LLaMA 3.2 和 Qwen3:Qwen3 尽管偏离了正确的解决方案,但表现出了强大的设计师:程序员角色一致性。其他配对偏离了任务,从未收敛到结果。这些发现促进了对代理编程的理解,并强调需要进一步研究理解和校准未来自主 SE 所必需的收敛和停止条件。