论文

CoTZero:经由分层合成 CoT 实现免标注的类人视觉推理

CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT

模型训练强化学习合成数据RLVR

摘要

视觉语言模型(VLM)的最新进展显著改善了图文对齐,但仍未达到类人视觉推理的水平。一个关键局限是,许多 VLM 依赖表面相关性而非构建逻辑一致的结构化表示,这常导致遗漏更高层的语义结构和非因果的关系理解,阻碍组合式与可验证的推理。为通过将人类认知模型引入推理过程来解决这些局限,我们提出 CoTZero,一个免标注范式,包含两个组件:(i) 双阶段数据合成方法;(ii) 认知对齐的训练方法。在第一个组件中,我们从神经认知学关于组合生产性与全局到局部分析的论述中汲取灵感。在自底向上阶段,CoTZero 提取原子视觉基元,并逐步将其组合成多样、结构化的问题-推理形式。在自顶向下阶段,它以粗粒度全局结构引导对局部细节与因果关系的解释,从而实施分层推理。在认知对齐训练组件中,基于合成的 CoT 数据,我们在强化微调(RFT)中引入认知连贯可验证奖励(CCVR),通过对推理连贯性与事实正确性提供逐步反馈,进一步增强 VLM 的分层推理与泛化能力。实验表明,CoTZero 在我们带有词汇扰动负例的多层语义不一致基准上,于域内与域外设置中均达到 83.33% 的 F1 分数。消融实验证实,每个组件都有助于实现更具可解释性、更与人类对齐的视觉推理。

CoTZero:经由分层合成 CoT 实现免标注的类人视觉推理
图1:我们的免标注数据生成流程。从外部图像输入出发,VLM生成丰富的图像描述,再由LLM将其结构化为(实体, 关系, 实体)三元组。随后,这些三元组通过受控提示转化为yes/no问答对。该流程无需人工标注即可提供可扩展、细粒度且语义一致的监督。