论文

FORT-Searcher:综合抗捷径搜索任务以训练深度搜索代理

FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents

模型训练合成数据

摘要

训练深度搜索代理需要可验证的问题,在通过搜索获得足够的证据之前,这些问题的答案仍然不可用。现有的综合方法通常通过丰富图结构来增加明显的难度,但结构复杂性本身并不能保证实现的搜索难度:预期的搜索过程可能会通过更便宜的识别路线而崩溃。我们通过捷径感知难度框架来形式化这一差距,并确定了四种可操作的捷径风险:证据共同覆盖、单线索选择性、暴露常数和先验知识绑定。为了诊断其实现的效果,我们使用轨迹特征,包括解决成本、答案命中时间和先验捷径率。在此框架的指导下,我们引入了 FORT,一种抗捷径训练数据合成框架。 FORT 通过控制实体选择、证据图构建、问题制定和对抗性细化中的捷径风险来构建抗捷径训练数据。实验表明,与现有的开源深度搜索数据集相比,FORT 会导致更长的预答案搜索和更少的快捷模式。使用生成的轨迹,我们仅使用受监督的 微调 (SFT) 来训练 FORT-Searcher,并且它在具有挑战性的深度搜索基准上在同等规模的开源搜索代理中实现了最佳的整体性能。相关资源将在 https://github.com/RUCAIBox/FORT-Searcher 上提供。