论文
AgentStream:自演化LLM Agent在流式任务中的表现如何?
AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
摘要
大语言模型(LLM)代理可以通过不断改进来自我进化,但现有的研究大多采用独立评估。因此,现有研究中,自我进化代理在现实中的流式设置中的行为,特别是在代理适应多种复杂任务流的情况下,仍然不清楚。为了解决这一差距,我们引入了AgentStream,这是一个统一的框架,用于评估涵盖不同进化组件的自我进化代理。通过将代理基准组织成可配置的任务流,并在测试时间实例化具有不同流变体的 \texttt{Isolated}、\texttt{Sequential} 和 \texttt{Interleaved} 流式场景,我们逐步变化流的范围和领域组成。在这些场景下,我们组合性地评估了五个代表性自我进化方法,跨三个前沿基础模型,解构了模型能力、方法架构和流式场景如何共同塑造自我进化。我们的结果表明,自我进化可靠性在不同流式场景中变化,自我进化的好处受模型能力限制,且在模型强度非单调。这些发现为在模型和流式场景下选择自我进化方法提供了具体指导。总的来说,我们主张,自我进化代理应该在现实任务流中进行评估,而不是孤立地进行单任务设置。
