论文

ToolSciVer:使用视觉工具增强强化学习进行多模式科学主张验证

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

智能体系统模型训练强化学习Agent 工具调用Agentic RL

摘要

多模式科学声明验证 (MSCV) 需要模型使用论文中的视觉证据(包括图形、表格、图表和文本上下文)来验证科学声明。然而,现有的方法常常失败,因为它们很难找到决定性的视觉证据,准确地读取结构化的科学视觉效果,并将多模态观察整合到可靠的推理中。我们介绍 ToolSciVer,这是我们所知的第一个 MSCV 工具增强框架。 ToolSciVer 为 VLM 配备了三种类型感知的视觉工具、表格行/列焦点、图表到结构解析和高分辨率区域缩放,将密集的科学视觉效果转换为明确的、面向索赔的证据,并在答案正确性、格式有效性、长度控制、工具使用效率和工具有效性惩罚的综合奖励下使用组相对策略优化 (GRPO) 来训练策略。对来自三个模型系列(Qwen、InternVL、Gemma)的五个 VLM 的 SciVer 和 MuSciClaims 数据集进行的实验表明,与四个竞争基线(包括基于提示和基于 RL 的工具使用方法)相比,我们的方法实现了卓越的性能,突出了学习的、类型感知的工具使用用于科学声明验证的有效性。