论文
FaithEyes:通过多代理过程图像自我验证实现忠实的工具使用
FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Self-Verification
摘要
代理视觉语言模型(VLM)将文本推理与显式工具调用(例如裁剪和基于代码的图像处理)交织在一起,已成为可靠且可解释的多模态推理的引人注目的范例。然而,最近的研究表明,此类模型经常不忠实地使用工具。许多过程图像与问题无关(例如,作物错过了查询的目标),但工具调用仍然得到充分的认可,并且模型仍然正确回答。这种装饰性或错位的工具称为浪费计算,并表明模型没有忠实地使用它检索到的证据。这可能源于流行方法的两个局限性:工具奖励无法区分有用的调用和无用的调用,并且工具反馈不带有有用的信号。为此,我们引入了FaithEyes,一个多智能体自我判断框架。具体来说,我们使用VLM来判断每个过程图像是否有助于回答问题。将判断作为工具观察的一部分注入到推理上下文中以帮助后续推理,同时通过有用工具比率来缩放工具奖励以抑制奖励作弊。为了在评估时保持判断可用,我们进一步设计了一个多代理框架,其中模型本身作为子代理来判断主代理的工具调用,消除了推理时对外部模型的依赖。 FaithEyes 通过两阶段 SFT + RL 管道对改编的开源数据进行训练,在视觉感知和推理基准方面获得了具有竞争力或卓越的准确性,同时大幅改进了工具 忠实性 并降低了推理成本。主页位于 https://github.com/Mosi-AI/FaithEyes。