论文
从惯性到客观:用噪声隔离改进深度研究智能体
From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation
摘要
由大语言模型(LLM)驱动的网络搜索智能体展现出强大前景,但深度研究任务暴露出一个反复出现的失败模式:一旦智能体产出了某个查询、计划或中间结论,它在随后评判该行动的后果时客观性会下降。我们将这一现象命名为惯性偏差(inertia bias)。为使其可测量,我们引入IBIS基准,该基准在控制搜索观测的同时变化模型是否在评估自身先前行动的结果。我们发现,当模型“拥有”前序搜索步骤时表现明显更差,表明自撰的行动历史会系统性地扭曲后续判断。我们进一步表明,该偏差会传播为两种系统级退化:worker层的搜索噪声与manager层的上下文噪声。为解决该问题,我们提出NIS-Agent,在最容易受惯性偏差影响的两个决策点——网页分诊与最终答案校验——应用上下文隔离。在GAIA、WebWalkerQA、BrowseComp和BrowseComp-zh上,NIS-Agent取得有竞争力的性能,同时相对我们的基线减少33%的token成本。我们进一步训练了一个8B模型使其对惯性偏差具有内在抵抗力;在同一NIS-Agent框架下,它在深度研究基准上达到与GPT-4o相当的平均性能。
