论文

DENSE:将Agent轨迹蒸馏为证据锚定的嵌套捷径树以实现自我精炼

DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

在线 Agent 部署会产生大量执行轨迹,而针对特定任务的验证和专家标注难以低成本扩展。我们研究如何在没有事后结果标签的情况下,利用轨迹中关于局部进展、恢复过程和未完成要求的证据,提炼可复用的反馈。我们提出 DENSE(从嵌套子任务执行中蒸馏证据),将这些证据组织成有证据依据的嵌套捷径树。DENSE 压缩冗余尝试,利用恢复证据协调不同层级的问题,概括已完成的分支并展开尚未解决的分支,将可复用进展与剩余要求联系起来。我们引入 REFIT,一种按来源配对的评测协议:不同反馈方法共享初始轨迹,不能访问事后结果,并在环境和模型上下文重置后重新尝试相同任务。在 Terminal-Bench 2.1 上,DENSE 在四个接受反馈的模型中,均取得所测试的无特权反馈方法中最高的严格通过率。相较初始执行,严格通过率提升7.12—15.64个百分点,重试中观测到的模型 Token 用量减少19.0%—43.6%。GPT-5.5 消融实验支持将嵌套子任务分析、捷径构建与问题协调结合使用。这些结果表明,有证据依据的轨迹复用有望以更少外部监督支持 Agent 自我改进。

DENSE:将Agent轨迹蒸馏为证据锚定的嵌套捷径树以实现自我精炼:论文配图
图1:执行轨迹不断积累,而外部监督成本高且规模有限。这些轨迹中的证据能否在不依赖事后结果标签的情况下支持经验复用?