论文
CoTZero:经由分层合成 CoT 实现免标注的类人视觉推理
CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT
摘要
视觉语言模型(VLM)的最新进展显著改善了图文对齐,但仍未达到类人视觉推理的水平。一个关键局限是,许多 VLM 依赖表面相关性而非构建逻辑一致的结构化表示,这常导致遗漏更高层的语义结构和非因果的关系理解,阻碍组合式与可验证的推理。为通过将人类认知模型引入推理过程来解决这些局限,我们提出 CoTZero,一个免标注范式,包含两个组件:(i) 双阶段数据合成方法;(ii) 认知对齐的训练方法。在第一个组件中,我们从神经认知学关于组合生产性与全局到局部分析的论述中汲取灵感。在自底向上阶段,CoTZero 提取原子视觉基元,并逐步将其组合成多样、结构化的问题-推理形式。在自顶向下阶段,它以粗粒度全局结构引导对局部细节与因果关系的解释,从而实施分层推理。在认知对齐训练组件中,基于合成的 CoT 数据,我们在强化微调(RFT)中引入认知连贯可验证奖励(CCVR),通过对推理连贯性与事实正确性提供逐步反馈,进一步增强 VLM 的分层推理与泛化能力。实验表明,CoTZero 在我们带有词汇扰动负例的多层语义不一致基准上,于域内与域外设置中均达到 83.33% 的 F1 分数。消融实验证实,每个组件都有助于实现更具可解释性、更与人类对齐的视觉推理。
