论文
Latent Agents:一种内化多智能体辩论的后训练方法
Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
摘要
多智能体辩论已被证明能提升大语言模型(LLM)的推理能力。然而它计算开销巨大,需要在回答问题之前生成长篇的辩论记录。为解决这一低效问题,我们开发了一个框架,通过两阶段微调流水线将多智能体辩论蒸馏进单个 LLM,该流水线将辩论结构学习与经由动态奖励调度和长度裁剪实现的内化相结合。在多个模型和基准上,我们的内化模型以最多减少 93% 的 token 达到或超越显式多智能体辩论的性能。随后,我们通过激活引导(activation steering)研究这一能力的机制基础,发现内化创造了智能体特异的子空间:激活空间中对应于不同智能体视角的可解释方向。我们进一步展示了一个实际应用:通过内化辩论将恶意智能体注入 LLM,再施加负向引导将其抑制,我们表明蒸馏使有害行为更容易被定位和控制,且与引导基座模型相比,对通用性能的削减更小。我们的发现为理解蒸馏模型中的多智能体能力提供了新视角,并为控制内化推理行为提供了实用指南。代码见 https://github.com/johnsk95/latent_agents
