论文

从诊断到重新设计:使用定量人种学改进多智能体 LLM 推理

From Diagnosis to Redesign: Using Quantitative Ethnography to Improve Multi-Agent LLM Reasoning

智能体系统Agent 协作

摘要

多代理 大语言模型 (LLM) 系统旨在通过在具有专门功能的多个代理之间分解任务来改进推理,但多个代理的存在并不能本质上保证与任务目标一致的连贯推理或输出。本文介绍了一种定量人种学 (QE) 方法,用于根据代理交互产生的话语来诊断和重新设计多代理 LLM 系统。我们使用自动论文评分作为示例背景来测试这种方法,应用认知网络分析(ENA)对五代理多代理辩论系统进行建模,并检查产生正确与错误评分决策的辩论之间的差异。结果表明,在最初的系统中,正确的评分决策的特点是基于标题的论证、一致和阐述。相比之下,不正确的评分决策的特点是延长命题-挑战-回应交换,而与评分标准的联系不太一致。然后我们利用调查结果来修改代理的提示。修订后的系统将准确评分准确率从 27.78% 提高到 40.28%,并将错误辩论的话语转向正确辩论的基于标题的模式,使两者几乎无法区分。基于这些结果,我们认为 QE 可以通过跟踪代理交互模式与系统性能的关系、通知及时重新设计以及评估这些重新设计是否改变结果和交互模式,来支持人工智能推理的诊断到重新设计循环。