论文

Latent Agents:一种内化多智能体辩论的后训练方法

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

摘要

多智能体辩论已被证明能提升大语言模型(LLM)的推理能力。然而它计算开销巨大,需要在回答问题之前生成长篇的辩论记录。为解决这一低效问题,我们开发了一个框架,通过两阶段微调流水线将多智能体辩论蒸馏进单个 LLM,该流水线将辩论结构学习与经由动态奖励调度和长度裁剪实现的内化相结合。在多个模型和基准上,我们的内化模型以最多减少 93% 的 token 达到或超越显式多智能体辩论的性能。随后,我们通过激活引导(activation steering)研究这一能力的机制基础,发现内化创造了智能体特异的子空间:激活空间中对应于不同智能体视角的可解释方向。我们进一步展示了一个实际应用:通过内化辩论将恶意智能体注入 LLM,再施加负向引导将其抑制,我们表明蒸馏使有害行为更容易被定位和控制,且与引导基座模型相比,对通用性能的削减更小。我们的发现为理解蒸馏模型中的多智能体能力提供了新视角,并为控制内化推理行为提供了实用指南。代码见 https://github.com/johnsk95/latent_agents

Latent Agents:一种内化多智能体辩论的后训练方法:论文配图
图 1:内部化多代理辩论 (IMAD) 管道概述。 1. 我们首先使用算术任务的标准多智能体辩论协议收集辩论数据集。使用该数据集,通过监督微调训练单个 LLM 代理以学习辩论结构。然后,通过强化学习进一步优化同一个代理,以内化其辩论过程。 2. 我们通过 IMAD 提炼与不同智能体的争论,并通过特定于智能体的引导来引出每个智能体的特征,从而识别内化模型中的智能体子空间。 3. 我们进一步证明,通过提取恶意代理的引导向量并对 IMAD 模型进行负向引导,可以抑制蒸馏后的恶意代理特征。