论文

学习激活什么:面向长时程多模态Agent的组合式能力分配

Learning What to Activate: Combinatorial Capability Allocation for Long-Horizon Multimodal Agents

模型优化模型训练强化学习蒸馏Agentic RL

摘要

长时程多模态Agent依赖感知、检索、推理、验证与执行等专用能力。现有设计通常激活固定的能力集合或调用预定义工作流,带来可观的计算开销,同时无法适应随阶段变化的能力需求。本文研究长时程多模态Agent系统的组合式能力分配问题:系统在每个交互阶段选择一个成本敏感的专用能力子集。这一问题并不平凡,因为能力的价值依赖于所选子集,而先前的分配又会改变后续决策所遇到的状态。我们提出CoCA,一个从稀疏条件比较中恢复可部署能力子集策略的在策略学习框架。在学生策略访问到的状态上,更强的教师以当前已选子集为条件比较候选能力的边际净值。随后,我们采用条件效用模型将这类比较转化为自回归的能力子集策略,避免显式枚举。我们进一步引入双层在策略蒸馏,以同时应对环境状态之间以及集合构建过程中遇到的部分子集内部的分布失配。最后,轨迹级强化学习将蒸馏后的策略朝任务成功、激活成本与分配稳定性方向精调。在推理时,分配仅由轻量学生策略完成,无需教师查询或在线更新。在长时程多模态环境与受控能力需求变化上的实验表明,我们的方法优于最先进的基线方法。

学习激活什么:面向长时程多模态Agent的组合式能力分配:论文配图
图 1:所提出的 CoCA 框架概览。图中展示了从条件偏好建模、教师引导的策略构建,到双层蒸馏与轨迹级优化的学习流水线。