论文

多范式代理交互实践:buddyMe框架中Generator-Evaluator、ReAct循环与对抗评估的系统性分析

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

大语言模型(LLM)代理的快速演进产生了多样的交互范式,但很少有生产系统在统一架构中集成多种范式。本文对三种主要代理交互范式进行系统分析,包括多代理编排(Generator-Evaluator)、ReAct工具使用循环和记忆增强交互,均实现于buddyMe——一个开源多模型代理编程框架。我们形式化了一个五阶段处理流水线:需求预审 -> 任务分解 -> ReAct执行 -> 真实执行验证 -> 对抗评估讨论,并建立了带加权评分的六维评估模式。通过取自真实部署日志的四个实证案例研究——涵盖博物馆导览生成、定时天气任务与综合行程规划——我们得出三个关键结论。第一,Generator-Evaluator预审在20%的复杂任务中检出需求遗漏,80%的任务通过初检。第二,ReAct循环确保子任务稳定执行,但导致约30%的冗余工具调用。第三,对抗式Evaluator-Defender讨论在近70%的场景中于2-3轮内达成共识,其作用主要是内容打磨而非逻辑反转。我们还提供了三张基于Mermaid的架构图,并在六个系统维度上与CrewAI、AutoGen、LangGraph、MemGPT和A-Mem进行跨范式比较。研究成果为构建稳定可靠的多范式代理系统提供了实用设计准则。