论文

AgentStream:自演化LLM Agent在流式任务中的表现如何?

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

智能体系统Agent任务评测智能体自我改进

摘要

大语言模型(LLM)代理可以通过不断改进来自我进化,但现有的研究大多采用独立评估。因此,现有研究中,自我进化代理在现实中的流式设置中的行为,特别是在代理适应多种复杂任务流的情况下,仍然不清楚。为了解决这一差距,我们引入了AgentStream,这是一个统一的框架,用于评估涵盖不同进化组件的自我进化代理。通过将代理基准组织成可配置的任务流,并在测试时间实例化具有不同流变体的 \texttt{Isolated}、\texttt{Sequential} 和 \texttt{Interleaved} 流式场景,我们逐步变化流的范围和领域组成。在这些场景下,我们组合性地评估了五个代表性自我进化方法,跨三个前沿基础模型,解构了模型能力、方法架构和流式场景如何共同塑造自我进化。我们的结果表明,自我进化可靠性在不同流式场景中变化,自我进化的好处受模型能力限制,且在模型强度非单调。这些发现为在模型和流式场景下选择自我进化方法提供了具体指导。总的来说,我们主张,自我进化代理应该在现实任务流中进行评估,而不是孤立地进行单任务设置。

AgentStream:自演化LLM Agent在流式任务中的表现如何?:论文配图
图1:独立评估与本文流式评估框架的对比。(a) 主流范式将每项任务孤立解决,不积累跨实例经验。(b) AgentStream:有状态智能体在可配置任务流中借助自身生成的反馈不断演化;基础模型、自演化方法和任务流组合是模块化设计维度。