论文
IterSynth:通过角色解耦迭代综合重新思考深度搜索代理
IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis
摘要
深度搜索要求 LLM 代理分解复杂的查询、搜索证据并综合有根据的答案,但现有的 ReAct 风格的代理受到两个限制:角色耦合,其中一项策略必须处理规划、证据使用和综合;以及上下文积累,不断增长的搜索历史会引入噪音并掩盖有用信息。为了解决这些问题,我们提出了 IterSynth,这是一种角色解耦且基于摘要的范例,它在用于识别信息需求的规划器和用于将证据集成到不断发展的摘要状态的合成器之间交替。这种设计将规划与综合分开,同时使用摘要作为搜索的持久状态,从而减少了能力耦合和上下文噪声。为了有效地训练 IterSynth,我们进一步引入了用于强化学习的角色解耦策略优化(RDPO),它将最终结果奖励与轮级评估相结合,并计算特定于角色的优势以实现更精确的学分分配。在 BrowseComp 和 Xbench-DS 等五个长视野深度搜索基准上的实验表明,IterSynth-8B 的平均得分为 50.7,比之前最强的 $\leq$8B 代理高出 +4.2\%。此外,IterSynth 作为一种与模型无关的提示范例,与 ReAct 和前沿专有模型上的类似提示范例相比,提供了显着的零样本增益。