论文
AgentPatch:面向Agentic MLLM合并的由粗到细弱任务修复
AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models
摘要
Agentic多模态大语言模型(MLLM)在多模态感知与推理之上扩展了动态环境中的规划、工具使用与交互。然而,当前模型针对特定工具或环境专门化,使其难以整合为单一通用模型。我们提出Agentic MLLM合并(Agentic MLLM Merging)问题,并识别出两个挑战:非对称能力保持,即交互复杂度不同的能力在合并后保留不均,产生弱任务;以及行为关键遗忘,即丢失决定性行动会使长程执行脱轨。我们提出AgentPatch,一个免训练的由粗到细修复框架。它选择一个稳定的合并骨干,通过弱任务独有残差恢复(Weak-Task Unique Residual Recovery)恢复被稀释的弱任务特定信号,并应用Agent引导的行为关键补丁(Agent-Guided Behavior-Critical Patch),在显式能力保护下恢复决定性行为。AgentPatch产出一个无路由、无集成的单一静态检查点。在六个agentic与多模态基准上的实验表明,AgentPatch改进了多种合并骨干,缓解弱任务退化,并更好地平衡弱任务恢复与互补搜索及agentic视觉处理能力的保持。代码见 https://github.com/ziboshao/AgentPatch。
