论文

MM-VeriAgent:通过强化学习学习多模态核验工具调用

MM-VeriAgent: Learning to Use Extensive Tools to Verify Multimodal Misinformation with Reinforcement Learning

模型训练智能体系统强化学习Agent 工具调用Agentic RL

摘要

现实世界的多模态错误信息通常涉及混合伪造来源,需要针对特定样本的检测策略。现有的工具增强方法依赖于预定义的工作流程或推理时间规划,限制了适应性或增加了推理成本。为了解决这个问题,我们引入了 MM-VeriAgent,它学习使用工具验证混合源多模态错误信息。我们首先构建 MM-VeriTools,一个用于错误信息检测智能体的专用工具包。通过对混合源检测所需的子任务的各种候选模型和方法进行基准测试,我们选择最强大的文本、视觉和跨模式伪造分析,并将它们封装为具有统一接口的可调用工具。在此工具包之上,我们通过强化学习来训练 LVLM 智能体,教它如何使用这些工具来更好地解决混合源检测。由于许多工具都是专门的模型,每次轨迹采样时都在线执行,严重限制了强化学习的效率,因此我们进一步引入了 工具执行缓存,它预先执行候选工具调用并在训练期间重用其缓存的输出。这保留了多步轨迹展开,同时减少了在线工具执行,极大地提高了训练效率。MMFakeBench 上的实验表明,在推理时无需显式工具搜索的情况下,基础模型的准确度大幅提高。消融和效率分析进一步验证了学习到的工具使用策略,并表明工具执行缓存减少了训练期间的在线工具执行。

MM-VeriAgent通过多轮策略调用文本、视觉及跨模态核验工具。
图1(图注摘要):MM-VeriAgent通过多轮策略调用文本、视觉及跨模态核验工具。