论文
DENSE:将Agent轨迹蒸馏为证据锚定的嵌套捷径树以实现自我精炼
DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement
摘要
在线 Agent 部署会产生大量执行轨迹,而针对特定任务的验证和专家标注难以低成本扩展。我们研究如何在没有事后结果标签的情况下,利用轨迹中关于局部进展、恢复过程和未完成要求的证据,提炼可复用的反馈。我们提出 DENSE(从嵌套子任务执行中蒸馏证据),将这些证据组织成有证据依据的嵌套捷径树。DENSE 压缩冗余尝试,利用恢复证据协调不同层级的问题,概括已完成的分支并展开尚未解决的分支,将可复用进展与剩余要求联系起来。我们引入 REFIT,一种按来源配对的评测协议:不同反馈方法共享初始轨迹,不能访问事后结果,并在环境和模型上下文重置后重新尝试相同任务。在 Terminal-Bench 2.1 上,DENSE 在四个接受反馈的模型中,均取得所测试的无特权反馈方法中最高的严格通过率。相较初始执行,严格通过率提升7.12—15.64个百分点,重试中观测到的模型 Token 用量减少19.0%—43.6%。GPT-5.5 消融实验支持将嵌套子任务分析、捷径构建与问题协调结合使用。这些结果表明,有证据依据的轨迹复用有望以更少外部监督支持 Agent 自我改进。