论文

从惯性到客观:用噪声隔离改进深度研究智能体

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

智能体系统上下文与知识上下文工程Agent 架构与控制循环

摘要

由大语言模型(LLM)驱动的网络搜索智能体展现出强大前景,但深度研究任务暴露出一个反复出现的失败模式:一旦智能体产出了某个查询、计划或中间结论,它在随后评判该行动的后果时客观性会下降。我们将这一现象命名为惯性偏差(inertia bias)。为使其可测量,我们引入IBIS基准,该基准在控制搜索观测的同时变化模型是否在评估自身先前行动的结果。我们发现,当模型“拥有”前序搜索步骤时表现明显更差,表明自撰的行动历史会系统性地扭曲后续判断。我们进一步表明,该偏差会传播为两种系统级退化:worker层的搜索噪声与manager层的上下文噪声。为解决该问题,我们提出NIS-Agent,在最容易受惯性偏差影响的两个决策点——网页分诊与最终答案校验——应用上下文隔离。在GAIA、WebWalkerQA、BrowseComp和BrowseComp-zh上,NIS-Agent取得有竞争力的性能,同时相对我们的基线减少33%的token成本。我们进一步训练了一个8B模型使其对惯性偏差具有内在抵抗力;在同一NIS-Agent框架下,它在深度研究基准上达到与GPT-4o相当的平均性能。

从惯性到客观:用噪声隔离改进深度研究智能体:论文配图
图1:两类噪声。绿色与蓝色词语分别表示有用信息与噪声。红色词语揭示两类噪声的成因。在子图 (a) 中,<web abstract> 表示 Google 搜索返回网页的摘要信息。对于两个看似相似的查询,结果却大相径庭。在案例 1 中,由于 LLM 固有的惯性偏差,工作者继续沿该查询搜索,最终得出错误答案。在子图 (b) 中,我们省略了管理者的思考与行动步骤,仅保留观察结果。上下文噪声误导管理者进行错误推理,最终产生错误答案。