论文

长任务中面向成本的选择性 Agent 批评

Selective Critique for Cost-Aware LLM Agents in Long-Horizon Decision Making

智能体系统Agent 架构与控制循环

摘要

提高大语言模型 (LLM) 智能体在长期决策中的可靠性仍然是一个关键挑战。当部署为与复杂环境交互的自主智能体时,早期错误可能会通过轨迹传播并导致级联故障。最近的方法通过结合外部批评或审议来提高可靠性,但在每一步调用这些机制都会大大增加 token 的消耗和延迟,限制实际部署。我们提出了 SAG(Self-improving 智能体 with Gated critique),这是一种成本感知框架,它将批评调用制定为长期交互过程中的逐步决策问题。 SAG 引入了一种轻量级的 无需训练门控机制,该机制使用在可接受的操作上计算的操作级模糊信号(全局熵和局部 top-2 裕度)来估计批评的效用。从决策理论的角度来看,这种机制近似于批评的信息价值(VoI),使智能体仅当其预期收益证明成本合理时才能有选择地分配昂贵的反馈。 SAG 进一步整合了在线引导式自我完善,使 执行模型 能够内化批评者辅助行为,并逐步减少对批评的依赖。在三个长期交互式基准测试和多个 骨干模型 模型中,与无批评和始终批评的智能体相比,SAG 显着改善了性能成本权衡。在 ALFWorld 上,SAG 将 任务成功率 从 24.6% 增加到 78.4%,同时保持与 ReAct 相当的 token 预算,从而使标准化 token 效率提高 $3.1\times$。此外,带有轻量级 3B 批评家的 7B 执行模型 的性能可与不带批评家的 14B 执行模型 相媲美,这表明选择性批评可以恢复审议的大部分可靠性优势,同时显着降低推理成本。

长任务中面向成本的选择性 Agent 批评:论文原图
图 2:SAG 概述。在每一步,行动层面的模糊性决定是否询问批评者;成功的轨迹会通过在线 SFT 定期提取到 执行模型 中。