论文

掩盖过时的观察结果有助于搜索代理——直到它不起作用:政权地图及其机制

Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism

上下文与知识上下文工程

摘要

长视野搜索代理通过许多工具调用积累大量检索到的内容,使得上下文预算效率变得越来越重要。最小的干预是随着轨迹的进展掩盖来自上下文的陈旧观察,但目前尚不清楚这种形式的上下文管理何时有帮助以及为什么有帮助。我们通过对各种代理主干(4B 到 284B 参数)和离线和实时网络代理搜索基准上的三个 检索器 进行系统扫描来研究观察掩盖。我们发现,当针对没有上下文管理的模型精度进行绘制时,掩蔽的精度增益遵循不对称的倒 U 形:弱 检索器 下的稳定状态,强 检索器 遇到中等容量模型时的峰值,以及模型饱和时的急剧崩溃。该模式反映了 检索器 召回率与模型隐式过滤能力之间的相互作用,而不是孤立的任一因素。从机制上讲,屏蔽实现了词元与回合的权衡:它消除了模型基本上停止关注的观察结果,并且代理很少重新打开页面。当它们将失败转化为成功时,添加的转弯会有所帮助,但当掩蔽消除了模型本来会使用的证据时,它们就会失败。因此,我们将上下文管理重新定义为一种依赖于制度的干预,并为分析代理深度搜索中的上下文使用提供了整体视角。我们在这里发布了我们的脚手架和轨迹(https://github.com/i-DeepSearch/observation-masking)以支持未来的研究。