论文
自我进化的视觉提问者
Self-Evolving Visual Questioner
摘要
视觉语言模型(VLM)通常被训练为被动回答者,而它们主动提出多样化、重要、以视觉为中心和有视觉依据的问题的能力仍未得到充分探索。现有视觉提问者的表现受到高质量训练数据的可用性或管理这些数据的成本的瓶颈。我们证明,VLM 作为视觉提问者可以在没有任何外部监督的情况下不断改进自身。我们提出了一个自我进化的框架,它使用 VLM 本身作为提议者和过滤器来产生更难、信息更丰富且以视觉为中心的问题,同时保持其探索多样性以避免训练崩溃。然后使用这些问题以提问者和回答者模式训练 VLM。为了评估提问者,我们引入了一种代理协议,可以从感知、推理和多样性维度评估问题。跨各种骨干 VLM 的实验表明,我们的方法大大提高了自主问题生成的质量并大大扩展了难度边界。在相同的预算下,我们的自我监督比静态源数据的训练更有效。此外,自我进化的提问者仍然是一个有竞争力甚至更好的回答者。