论文
VISA:用于多模式指令跟踪的代理自进化数据合成
VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
摘要
多模式指令跟踪模型需要准确、多样化、可验证且具有挑战性的训练数据。现有的综合管道通常遵循一次性生成和过滤范例,丢弃来自失败样本、验证器结果和目标模型错误的反馈。我们提出了 VISA(视觉指令合成代理),这是一种代理框架,它将多模式指令合成重新表述为一个自我进化的循环。在每一轮中,VISA 都会分析图像以过滤不兼容的约束并发现新的可验证约束,从持久内存中对多样性和难度感知约束集进行采样,生成候选指令,并使用可执行工具和结构化 大语言模型 判断来验证生成的样本。失败的样本会触发诊断引导的恢复,而接受的样本则根据目标模型进行探测以估计难度。生成的验证器信号和目标模型故障配置文件被写回内存,允许后续轮次自适应地扩展约束空间,减少模板重复,并专注于未解决的模型弱点。相同的验证者合约进一步为强化学习提供奖励信号,而无需单独训练的奖励模型。 MM-IFEval 实验表明,VISA 在强基线上持续改进多模态指令,同时在七个公共基准中保留一般多模态能力。