论文
VeriEvol:经可验证Evol-Instruct扩展多模态数学推理
VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
摘要
为视觉数学推理扩展强化学习需要的比生成更难的问题更多:随数据量增长——奖励标签本身必须保持可靠。但既有数据管线在信任标注者的同时扩展监督——策略侧方法则假设底层答案已经正确。我们转而把扩展当作可验证的数据构建问题——在任何策略更新前解耦两个轴:提示难度(经路线特定演化算子扩展)与答案可靠性(经离线假设检验证伪强制)。我们将其实例化为VeriEvol——含两个可扩展组件的迭代框架:类型感知演化模块——把低难度图文种子改写为更难、图像定位的提示;HTV-Agent——验证器——仅在多源反证未能驳倒答案后才接受它。所得经验证数据在量上扩展、经添加演化路线或验证器通道扩展——并直接插入既有GRPO式RL配方。在五基准视觉数学套件上——把演化SFT数据从1万扩到25万样本使平均准确率从35.42升至54.73;然后在骨干、SFT初始化与GRPO配方固定下——VeriEvol较未演化RL基线累计+3.88——其中+1.82来自演化提示、+2.06来自HTV-Agent验证器。我们发布提示、数据、模型、代码与每样本完整验证器踪迹——使下游工作可扩展并审计管线而非仅检查其输出。
