论文
约束锚定推理轨迹
Constraint-Anchored Reasoning Traces
摘要
自回归多模态大语言模型(MLLM)受错误雪球困扰:思维链(CoT)轨迹早期的单个错误推理会污染全部下游推理。我们发现,在最先进的开源MLLM中,一旦出现首个错误,65%的情形会在其余所有步骤中级联为失败(我们称之为雪球率)。现有缓解手段——采样多条链、事后自验证或完整程序合成——要么缺乏符号基础,要么发现错误太晚,要么牺牲自然语言推理的灵活性。我们提出约束锚定推理轨迹(CART),一个神经符号框架:训练MLLM把自然语言推理步骤与符号约束断言交错——关于视觉内容的轻量、机器可查语句(如count(red_objects)=3)。双管齐下的约束传播模块——结合学习的神经落地头与布尔约束传播——持续对照抽取的视觉特征核验这些锚点并检查其相互逻辑一致性;检测到矛盾时,回溯控制器暂停生成并回退到最近的一致检查点,阻止错误传播;变频发射机制让模型自适应控制锚点密度,避免轨迹膨胀。我们以从场景图导出的真值约束标注增强GQA、CLEVR-CoGenT与VCR,构建21.8万训练实例,并经LoRA微调开源MLLM(LLaVA-NeXT、Qwen2-VL)。在五个基准上,CART把雪球率从0.65降至0.14,GQA准确率较仅训练基线提升4.6个百分点,POPE-all达89.1 F1,推理开销至多18%。
