论文

LLM 什么时候应该搜索?搜索路由的反事实监督

When Should LLMs Search? Counterfactual Supervision for Search Routing

上下文与知识检索增强

摘要

搜索增强语言模型可以使用外部证据来弥补参数知识的局限性,但搜索并不总是有益的:模型可能会调用搜索它们已经可以回答的问题,或者在纠正、澄清或放弃更合适时依赖噪音证据。我们将其表述为实例级搜索路由问题:决定是否需要搜索来提高相对于无搜索执行的任务成功率。为了获得监督,我们比较同一问题的无搜索和强制搜索结果,并根据特定任务的成功情况构建一个关于“无搜索”、“搜索”和“未解决”的预言机。使用该预言机作为评估标准和学习信号,我们通过监督 微调 和偏好优化来训练搜索路由策略,将预言机合格示例上的路由宏 F1 从 Gemma E2B 的 0.7082 改进到 0.8235,将 Qwen3.5-4B 从 0.7053 改进到 0.8365。进一步分析表明,学习到的策略减少了模型特定的路由失败:Gemma 主要学习无搜索限制,而 Qwen 进一步减少了错过的搜索;剩余的未解决案例揭示了涉及模型容量、检索预算、证据使用和政策行为的异构瓶颈。