论文

DiffuseAgent-MI:基于分布式、工具集成的自我进化代理,用于忠实的视觉推理

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

智能体系统Agent 架构与控制循环

摘要

工具集成的视觉语言代理在组合和多步骤视觉推理方面取得了显着进展。然而,它们的输出经常表现出不忠实性:规定的推理路径与实际产生答案的计算背道而驰,从而损害了安全关键型应用程序的可靠性。我们提出了 DiffuseAgent-MI,一种自我进化的代理,其感知基础由特征单元上的 KL 最小能量模型控制,提供了视觉机械可解释性的分布视图。智能体学习一种能量景观,该能量景观轻轻地约束生成的样本位于以所选可解释单元为条件的本地先验附近,从而缩小了解释与内部表示之间的差距。然后,验证者提供轨迹级 忠实性 奖励,并且当验证者标记不忠实步骤时,修复分支会重新调节能量。在 GeoQA、SciVis、VQA-v2 和内部多模态推理集上,DiffuseAgent-MI 的准确性比之前的自我进化代理提高了 5.1 分,同时互信息 忠实性 和人类可解释性协议提高了一倍多。我们的分析表明能量项和验证器是互补的:前者保证分布式 忠实性,后者保证轨迹级 忠实性,并且只有它们的组合才能弥补这两个差距。