论文
CoVA-SFT:视觉抽象链的大规模数据集
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
摘要
思想链 (CoT) 推理允许将问题分解为中间步骤,从而显着改进了 大语言模型 (LLM)。虽然 CoT 对于语言任务广泛有效,但纯文本 CoT 迫使模型将视觉问题序列化为笨拙的散文。尽管存在处理视觉输入的架构解决方案,但社区缺乏大量、多步骤、自我校正的数据集来教导模型在解决纯文本推理问题时如何构建和维护内部视觉工作区。为了解决这一限制,我们引入了 CoVA-SFT,这是一个由 51.9K 样本组成的高度结构化语料库,包含跨 5 个不同布局系列和 17 个复杂任务的超过 222K 多模态推理步骤,以及 CoVA-Bench,这是一个由 1,700 个测试样本组成的配套基准,涵盖相同的任务,以进行可重复的评估。通过提供明确的基本原理公式、代理渲染和验证循环,CoVA-SFT 教授多模态语言模型来交错文本和视觉抽象。我们通过证明在 CoVA-SFT 上微调的模型在 CoVA-Bench 上的性能平均优于所有交错 CoT 基线 2 倍以上来验证数据集,尽管它们仍然达不到强大的纯文本 CoT 基线,这凸显了未来工作的开放挑战。