论文

CaveAgent:将LLM转变为有状态运行时操作符

CaveAgent: Transforming LLMs into Stateful Runtime Operators

智能体系统上下文与知识记忆Agent HarnessAgent记忆Agent Runtime

摘要

基于LLM的Agent越来越能够执行复杂任务,但当前系统仍受以文本为中心的范式限制。传统方法依赖过程式、基于JSON的函数调用,多轮依赖脆弱且容易发生上下文漂移,因而难以处理长程任务。本文提出CaveAgent,将“LLM即文本生成器”转变为“LLM即运行时操作器”。双流上下文架构把状态管理拆分为负责推理的轻量语义流,以及负责执行的持久、确定性Python运行时流。框架既利用代码生成在单步内解决循环、条件等相互依赖的子任务,又引入有状态运行时管理。不同于仍受文本限制、缺乏外部对象注入与检索支持的代码型方法,CaveAgent能够注入、操作和检索跨轮次持久保存的复杂Python对象,如DataFrame和数据库连接。这种持久机制作为高保真外部记忆,用于消除上下文漂移、避免灾难性遗忘,并让处理后的数据无损流向下游应用。作者在Tau²-bench、BFCL及多个案例中测试了代表性先进LLM:零售任务成功率提升10.5%,多轮场景总Token消耗降低28.4%;数据密集型任务通过直接存储和检索变量降低59%的Token消耗,并能处理导致JSON型和代码型Agent上下文溢出的数据规模。

CaveAgent:将LLM转变为有状态运行时操作符 配图
图 4:框架概览