论文

从专有到开源:智能体搜索中经由多智能体协议蒸馏弥合分布差距

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

摘要

智能体搜索使大语言模型能通过多步推理与检索交替解决知识密集型任务,但用基于结果的强化学习(RL)优化它只能提供稀疏监督。知识蒸馏可以提供更密集的引导,而具备强大推理能力的高级专有模型是有希望的教师。虽然从专有模型蒸馏能加密监督信号,但常规的logit匹配因logit不可见与分词器不匹配而行不通,而原始自然语言轨迹模仿只会迁移表层的风格痕迹而非核心推理能力。为解决异构蒸馏问题并弥合分布差距,我们提出多智能体协议蒸馏(Multi-Agent Protocol Distillation, MAPD),一个使用结构化、风格归一化协议作为中间表示的蒸馏与RL联合框架。一个离线多智能体系统(MAS)分解每个查询、检索支持证据、修复失败搜索,并将得到的探索轨迹转换为包含任务类型、推理计划与抽取式锚定事实的JSON协议。训练时,该协议只提供给策略的一个特权分支,其token分布在稀疏RL目标之外提供密集的蒸馏信号。跨七个QA基准的广泛评估表明,MAPD持续优于有竞争力的蒸馏与RL方法,在Qwen3-1.7B上取得39.4%、在Qwen3-4B上取得44.4%的平均成功率。关键的是,该框架能在多样的专有教师间稳健泛化,同时有效防止学生策略出现风格漂移与冗长退化。

从专有到开源:智能体搜索中经由多智能体协议蒸馏弥合分布差距:论文配图
图 1:从专有教师到开源学生的提炼面临两个瓶颈:(1) 异构分词器和不可访问的逻辑妨碍了直接对齐; (2)自由形式的自然语言轨迹模仿会导致风格漂移和幻觉。