论文

AgentPatch:面向Agentic MLLM合并的由粗到细弱任务修复

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

模型优化模型合并

摘要

Agentic多模态大语言模型(MLLM)在多模态感知与推理之上扩展了动态环境中的规划、工具使用与交互。然而,当前模型针对特定工具或环境专门化,使其难以整合为单一通用模型。我们提出Agentic MLLM合并(Agentic MLLM Merging)问题,并识别出两个挑战:非对称能力保持,即交互复杂度不同的能力在合并后保留不均,产生弱任务;以及行为关键遗忘,即丢失决定性行动会使长程执行脱轨。我们提出AgentPatch,一个免训练的由粗到细修复框架。它选择一个稳定的合并骨干,通过弱任务独有残差恢复(Weak-Task Unique Residual Recovery)恢复被稀释的弱任务特定信号,并应用Agent引导的行为关键补丁(Agent-Guided Behavior-Critical Patch),在显式能力保护下恢复决定性行为。AgentPatch产出一个无路由、无集成的单一静态检查点。在六个agentic与多模态基准上的实验表明,AgentPatch改进了多种合并骨干,缓解弱任务退化,并更好地平衡弱任务恢复与互补搜索及agentic视觉处理能力的保持。代码见 https://github.com/ziboshao/AgentPatch。

AgentPatch:面向Agentic MLLM合并的由粗到细弱任务修复:论文配图
图1:智能体化MLLM合并面临的两大挑战。(a) 在开发子集上的结果表明,合并方法对异构能力的保留不均衡,导致弱任务严重退化。(b) 丢失一个行为关键动作可能改变环境状态并引发轨迹级失败。