论文
为什么反馈增强的自蒸馏无法改进检索交织搜索智能体
Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?
摘要
在策略自蒸馏(OPSD)为不依赖独立教师模型训练大语言模型提供了有前景的路径。但它在复杂智能体任务上的有效性基本未被探索。本文实例化反馈增强自蒸馏(FA-SD),一个利用成功演示作为特权信息的智能体搜索自蒸馏算法。我们发现模型会依赖反复出现的“推理加搜索”输出模板,产出看似多样、却对输入问题基本无感的轨迹,使基于KL的自蒸馏信号失去信息量。我们把这一现象命名为解码坍缩——一种会被现有评估指标漏掉的失败模式。为理解其成因,我们展示尽管自教师取得更强表现,学习仍因监督信号不一致而本质上不稳定;我们进一步把不一致分解为模型不一致与提示不一致,并证明后者会显著降低监督信号质量、限制自教师学习的有效性。为缓解该不一致,我们引入指数移动平均(EMA)教师以稳定自教师、提供更一致的监督信号。尽管EMA教师需要预热期、其间性能可能暂时回退,它最终通过提供更稳定的监督改善模型表现。
