论文

不仅仅是推理,不仅仅是扫描:强化学习对学术论文进行主动科学错误验证

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 是越来越有能力的科学助手,但它们距离完全自主的研究还很远。这种转变需要模型主动检查学术论文,建立全局证据视图,并在没有预先指定问题或证据的情况下做出可追溯的判断。然而,现有的工作为此类缺乏问题和证据的验证提供了有限的任务范例或训练研究。我们通过科学的错误检测来研究这一挑战,其中模型必须确定错误是否存在,并通过基于证据的推理来证明错误的合理性。为了填补这一空白,我们提出了 VERA-RL,一种用于学术论文科学错误检测的强化学习公式。按照推理-验证-扫描的流程,我们构建了 VERA-13K,这是一个包含 12,900 个样本的数据集,组织成 4,300 个匹配链,涵盖整个研究工作流程和广泛的自然科学领域的 6 个科学错误类别。我们进一步引入了针对推理完整性、证据对齐和错误精度的细粒度奖励。使用 VERA-RL 训练 Qwen3-VL-8B 大大提高了可验证推理能力,在 Scan 上接近 Gemini 3 Pro 和 Qwen3-VL-235B-A22B 等旗舰 MLLM。