论文

OmniVerifier-M1:具有显式结构化重新校准的多模式元验证器

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

模型训练奖励建模与过程监督

摘要

视觉结果对于多模式 大语言模型 越来越重要,这使得可靠且细粒度的验证对于扩展通才基础模型至关重要。在这项工作中,我们研究了多模态元验证,它利用验证者生成的基本原理而不是仅决策信号,并探索如何有效地将元验证反馈纳入多模态验证者训练中。我们确定了两个关键发现。首先,作为元验证原理,符号验证器输出(例如边界框)优于文本解释,从而实现高效的基于规则的强化学习奖励,同时避免依赖辅助判断模型的基于模型的奖励。其次,由于输出结构和学习动态的内在差异,二元判断和元验证的解耦强化学习目标大大优于联合奖励优化。基于这些见解,我们训练了 OmniVerifier-M1,这是一种利用符号元验证和解耦强化学习的通用视觉验证器。 OmniVerifier-M1 提供强大的验证和细粒度的错误定位,并进一步支持 M1-TTS,这是一个验证者驱动的代理生成系统,可实现动态区域级自我校正。这种方法为更可靠、可解释和细粒度的多模式验证铺平了道路,支持更安全、更可控的基础模型部署。