论文
Skill-CMIB:通过条件多模态信息瓶颈实现一致行动的多模态代理技能
Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck
摘要
虽然基于 LLM 的代理擅长规划和执行长动作序列,但它们的执行在不同试验中通常不一致,从而限制了可靠性。巩固代理一致性需要将试错轨迹提炼为可重用的技能,以保留与任务相关的不变量,同时丢弃特定于轨迹的噪声。然而,在多模态环境中,关键的挑战不仅在于有用的不变量分布在视觉和语言信息中,而且在于不同的模态支持不同类型的可重用技能内容:虽然有些技能是可口头表达和解释的,但其他技能则存在于文本之外的感知证据中。纯文本技能可能会失去感知线索,而天真地存储文本和感知会引入冗余和噪音。现有的推理时间方法(例如自我一致性)通过昂贵的多样本解码来提高可靠性,而内化策略缺乏将可语言技能内容与残留感知信息分开的方法。为了解决这个问题,我们引入了条件多模态信息瓶颈(CMIB),这是一种多模态技能构建方法。 CMIB 从多模态技能的联合瓶颈开始,并得出精确的顺序分解:(1)提取可解释技能卡的文本阶段瓶颈,以及(2)仅压缩感知中的残余信息的条件多模态瓶颈,这些信息在文本之外仍然具有预测性。与朴素的双流公式不同,CMIB 明确地调节了文本技能中潜在的多模态,从而从结构上减少了跨模态冗余,并实现了对文本和感知压缩的独立控制。我们使用变分目标实例化 CMIB,使其条件分解易于优化,从而产生可重用的多模态技能,从而提高执行稳定性,而不会产生多样本推理开销。