论文

VeriEvol:经可验证Evol-Instruct扩展多模态数学推理

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

模型训练强化学习合成数据RLVRAgentic RL

摘要

为视觉数学推理扩展强化学习需要的比生成更难的问题更多:随数据量增长——奖励标签本身必须保持可靠。但既有数据管线在信任标注者的同时扩展监督——策略侧方法则假设底层答案已经正确。我们转而把扩展当作可验证的数据构建问题——在任何策略更新前解耦两个轴:提示难度(经路线特定演化算子扩展)与答案可靠性(经离线假设检验证伪强制)。我们将其实例化为VeriEvol——含两个可扩展组件的迭代框架:类型感知演化模块——把低难度图文种子改写为更难、图像定位的提示;HTV-Agent——验证器——仅在多源反证未能驳倒答案后才接受它。所得经验证数据在量上扩展、经添加演化路线或验证器通道扩展——并直接插入既有GRPO式RL配方。在五基准视觉数学套件上——把演化SFT数据从1万扩到25万样本使平均准确率从35.42升至54.73;然后在骨干、SFT初始化与GRPO配方固定下——VeriEvol较未演化RL基线累计+3.88——其中+1.82来自演化提示、+2.06来自HTV-Agent验证器。我们发布提示、数据、模型、代码与每样本完整验证器踪迹——使下游工作可扩展并审计管线而非仅检查其输出。

VeriEvol:经可验证Evol-Instruct扩展多模态数学推理:论文配图
图 2:VeriEvol 框架。两个核心组件将低难度的图像问题种子转变为闭环内经过验证的训练样本。 (左上,蓝色)提示难度控制通过问题门进化种子并过滤候选人。 (右,橙色)答案可靠性控制(HTV-Agent)伪造候选答案并通过确定性门承认它们。 (左下,紫色)闭环精炼将接受的样本具体化到 VeriEvol-SFT/VeriEvol-RL 中,并将其回收到种子池中。 §3.2、§3.3 和 §3.4 中详细介绍了各个阶段。