论文
TreeSeeker:深搜索中的树结构试验、错误与回退
TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search
摘要
深度搜索要求智能体通过多步骤的网络搜索、浏览、证据比较和综合来回答复杂的问题。一个核心挑战是,当几个方向看起来似乎合理,但只有其中一些方向后来会产生可靠的证据时,决定如何进行搜索。如果智能体贪婪地遵循当前最好看的方向,它可能会继续延长弱延续。如果没有纪律地进行探索,可能会在不连贯的试验上浪费预算。我们提出了 TreeSeeker,一种用于深度搜索中受控试错的推理时间框架。 TreeSeeker 将搜索组织为树结构状态上的分支返回搜索,其中每个分支都是子目标的暂定方向。在每一轮中,TreeSearch 都会读取所有子目标树,识别活动目标,并使用价值、不确定性和风险的文本 UCB 信号来选择利用有希望的分支、探索不确定的替代方案或修剪无生产力的延续并返回到较早的分支点。 TreeMem 通过将证据、不确定性、冲突、进展和失败线索保留在产生这些线索的分支上来支持这种控制循环,因此试验结果可以指导以后的决策。 XBench-DeepSearch、BrowseComp 和 BrowseComp-ZH 上的实验表明,TreeSeeker 始终优于强大的开源基线,这表明显式分支返回控制补充了更强大的推理和工具执行。
