论文

ScaffoldAgent:面向开放式深度研究的效用引导动态大纲优化

ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research

智能体系统Agent 规划Agent Harness

摘要

开放式深度研究(OEDR)要求系统经多轮检索获取知识——并生成连贯的长篇报告。大纲作为协调检索、证据组织与生成的结构脚手架起中心作用。但既有方法要么在写作前固定大纲——要么以局部启发式精化——导致持续信息积累下的脚手架漂移与评估大纲修改的反馈延迟。我们提出ScaffoldAgent——面向OEDR的效用引导动态大纲优化框架。ScaffoldAgent把大纲演化建模为含三个操作(扩展、收缩、修订)的结构化决策过程——实现对报告脚手架的受控更新。它进一步引入效用引导的反馈机制——从检索增益、结构连贯性与试生成质量估计每个大纲操作的下游价值。所得效用信号引导推理期间的选择、操作调度与终止。在DeepResearch Bench与DeepResearch Gym上的实验表明ScaffoldAgent持续改进长篇报告生成与事实锚定——超越既有深度研究智能体。

ScaffoldAgent:面向开放式深度研究的效用引导动态大纲优化:论文配图
图 1:动态轮廓优化的挑战。 C1:脚手架漂移。随着大纲不断更新新的证据和副主题,冗余的分支、不均匀的主题粒度和错位的部分可能会逐渐积累。 C2:延迟反馈。大纲修改无法立即获得反馈,因为其影响只能通过后续检索和试验生成才能观察到。