论文

Trinity:具有自我验证器的自我进化视觉语言模型

Trinity: Self-Evolving Vision-Language Models with a Self-Verifier

模型训练合成数据

摘要

自我进化视觉语言模型(VLM)是一种自我改进的形式,其中模型从未标记的图像生成自己的训练数据,是通向智能体的一条有前途的途径,它以无监督的方式扩展其推理能力,而不依赖于越来越大的注释预算。现有的方法将提出问题的提问者与回答问题的解答者配对,但主要通过采样答案之间的一致性来奖励这两个角色。一致性是真理的弱代表:它无法判断问题是否基于图像,提出的参考答案是否正确,或者有信心的大多数人是否以同样的方式错误。我们提出了三位一体,其中一个VLM扮演三个角色:提问者、解答者和验证者,而验证者是一个自我验证者:策略本身的指数移动平均线 (EMA),既不需要标签,也不需要外部判断。验证者在成为监督之前对每个生成的问题进行图像证据支持和答案正确性的筛选,对解决者针对图像的推理进行评分,并裁决参考答案和强大的解决者共识之间的争议,纠正参考并在共识正确时惩罚提问者。仅针对图像进行训练,Trinity 在数学视觉推理和生物学内容的科学基准上改进了 Qwen3-VL-8B,例如,SciVQR 的生物学分值 +8.6 分,MathVerse 的分值 +12.8,其奖励动态表现得像健康的自我游戏课程应有的那样。这些结果表明,自我进化的多模态智能体可以仅根据未标记的科学图像加强其科学推理,而模型本身则充当验证者。

Trinity:具有自我验证器的自我进化视觉语言模型的原论文方法或结果图
图 1:Trinity 训练循环。 策略 $\pi_{\theta}$作为提问者提出$G$候选QAs $\{(q,a)\}$; EMA验证器$\pi_{\phi}$筛选它们并选择$(q^{*},a^{*})$; 策略作为求解器生成 $K$ 完成结果 $\{(\tau,\hat{a})\}$,验证器对其进行评分。 $R_{Q}$和$R_{S}$驱动联合更新$\nabla_{\theta}\mathcal{L}_{\rm trinity}$,之后是$\phi\leftarrow\alpha\phi+(1-\alpha)\theta$。