论文

搜索而非猜测:教会小语言模型成为高效的搜索智能体

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

模型训练监督微调与指令调优

摘要

配备搜索工具的智能体已成为知识密集型任务的有效解决方案。尽管大语言模型(LLM)展现出强大的推理能力,其高昂的计算成本限制了搜索智能体的实际部署。因此,近期工作集中于将智能体行为从LLM蒸馏到小语言模型(SLM)。通过对复杂多跳推理任务的全面评估,我们发现尽管参数化知识较少,SLM调用搜索工具的频率反而更低,且更容易产生幻觉。为解决这一问题,我们提出\policy,一种轻量级微调方法,显式训练SLM可靠地检索并基于检索到的证据生成答案。与从LLM进行智能体蒸馏相比,我们的方法在Bamboogle上提升17.3分、在HotpotQA上提升15.3分,在各基准上达到LLM级结果。我们的进一步分析揭示,SLM中的自适应搜索策略常导致性能下降,这凸显了一致的搜索行为对可靠推理的必要性。