论文
请记住,不要重读:用于词元高效自主实验的状态 ReAct 代理
Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation
摘要
自动研究模式通过让 大语言模型 (LLM) 迭代修改代码以优化目标指标来实现自主实验。然而,其无状态设计在每次迭代时从头开始重建实验上下文,每次迭代产生 $O(n)$ 词元成本,总共 $O(n^{2})$。这项工作使用 LangGraph 将模式重新表述为有状态的 ReAct 代理,其中类型化的持久状态通过工具调用接口在迭代中携带实验历史记录。评估两个基准:超参数调整(15 次迭代,每次迭代的小观察)和代码性能优化(40 次迭代,包含完整源代码和基准测试结果的大每次迭代观察)。在超参数调整时,有状态代理消耗的词元减少了 90\%(2{,}492 vs.\ 24{,}465)。在代码优化方面,有状态代理消耗的词元减少了 52%(627K vs.1{,}275K),同时在两项任务上实现了相当的优化质量。词元减少是结构性的:无状态代理每次迭代以 $O(n)$ 成本重新读取完整历史记录,而有状态代理以 $O(1)$ 成本在固定大小的对话窗口内运行。本文足够详细地描述了该架构,以便从业者为自己的工作流程实现有状态的自动研究代理。