论文

AgentArk:将多智能体智能蒸馏进单个LLM智能体

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

摘要

虽然大语言模型(LLM)多智能体系统通过迭代辩论获得卓越的推理性能,但实际部署受到其高昂计算成本与误差传播的限制。本文提出AgentArk,一个将多智能体动态蒸馏进单个模型权重的全新框架,有效把显式的测试时交互转化为隐式的模型能力。这使单个智能体在保持计算高效的同时具备多智能体系统的智能。具体而言,我们在多种模型、任务、规模与场景下研究三种分层蒸馏策略:推理增强微调;基于轨迹的增强;以及过程感知蒸馏。通过把计算负担从推理转移到训练,蒸馏后的模型在保持单智能体效率的同时,展现出多个智能体强大的推理与自我纠正性能。它们还在多样化推理任务上表现出更强的鲁棒性与泛化能力。我们希望这项工作能为未来高效且鲁棒的多智能体开发研究带来启示。我们的代码见 https://github.com/AIFrontierLab/AgentArk。

AgentArk:将多智能体智能蒸馏进单个LLM智能体
图2:AgentArk 概览。该流程经过三个阶段:(1)通过多智能体辩论进行数据生成,产生多样化的推理轨迹;(2)知识提取,筛选高质量的纠错轨迹;(3)蒸馏,采用 Standard SFT、Reasoning-enhanced SFT、Distillation with Data Augmentation 以及 Process-Aware Distillation(PRM + GRPO)。所得学生模型实现了经过优化且低延迟的推理,并能泛化到多样的任务领域。