论文

BOUND:搜索控制边界处的简要引导纠正偏好 蒸馏

BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries

模型训练偏好优化

摘要

基于 大语言模型 (LLM) 的深度搜索代理通过迭代检索和推理来解决任务,但局部相关证据可能会导致持续的错误锚点漂移、约束漂移或局部主题漂移。现有的方法监督轨迹、结果或步骤,但很少区分与任务一致的延续与强化漂移的局部合理的延续。我们提出了 BOUND,一个用于持续搜索漂移的简短引导的纠正偏好 蒸馏 框架。对于每个学生引发的决策时间状态,BOUND 都会构建一个教师端的搜索状态摘要,保留原始搜索目标和关键约束,同时总结已确认的证据、缺失的信息和漂移状态。在简报的指导下,教师确定学生的延续是否包含可能影响后续决策的可纠正的局部搜索控制错误。与执行轨迹结果一起,此评估确定是否在学生特定的校正和原始延续之间构建校正对比,或者在支持的答案和不必要的检索延续之间构建终止对比。每个经过验证的状态匹配偏好对都可操作搜索控制边界。直接偏好优化(DPO)将这些偏好提炼给学生,而简短的教师端计算仍然仅限于训练。我们在四个多跳 QA 基准和三个深度搜索基准上评估 BOUND。在我们重新运行基线的 6 个基准中,BOUND 在 5 个数据集和 14 个指标中的 12 个上领先。在相同的搜索控制界面和匹配设置下,BOUND 在 Bamboogle 上比 Trajectory SFT 好 5.6 个 EM 点,在 BrowseComp-Plus 上比 Trajectory SFT 高 4.8 个准确度点。代码可在 https://github.com/RUCAIBox/BOUND 获取。