论文

内生重提示:统一多模态模型的自我进化认知对齐

Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models

模型训练强化学习RLVR

摘要

统一多模态模型(UMM)表现出很强的理解能力,但这种能力常常无法有效引导生成。我们将此识别为认知差距:模型缺乏对如何增强自身生成过程的理解。为弥合这一差距,我们提出内生重提示,一种通过在生成过程中生成自对齐描述符,将模型的理解从被动编码过程转变为显式生成推理步骤的机制。为此,我们引入SEER(Self-Evolving Evaluator and Reprompter),一个仅使用来自紧凑代理任务Visual Instruction Elaboration的300个样本建立两阶段内生循环的训练框架。首先,可验证奖励强化学习(RLVR)通过课程学习激活模型潜在的评价能力,产生高保真的内生奖励信号。其次,模型奖励思考强化学习(RLMT)利用该信号优化生成推理策略。实验表明,SEER在评估准确率、重提示效率和生成质量上持续优于最先进基线,且不牺牲一般多模态能力。

内生重提示:统一多模态模型的自我进化认知对齐
图2:SEER 概览。该框架通过两阶段内生循环弥合认知差距。RLVR:(步骤 1)收集内生图像对,用于(步骤 2)优化内部评估器。RLMT:(步骤 3)利用(步骤 4)由激活的评估器导出的相对奖励来优化 Reprompting 策略。