论文

推理指令可以破坏视觉语言模型中的答案解码

Reasoning Instructions Can Break Answer Decoding in Vision--Language Models

模型评测模型行为与机制分析

摘要

当评分者附加推理提示但在模型生成任何理由之前读取答案标签日志时,思想链 (CoT) 指令可能会扭曲多项选择 VLM 评估。我们称之为 CoT 前缀评分。在 ScienceQA 上,Qwen2.5-VL-7B 从 80.76% 下降到 45.48%,并且在五个选项内容排列中,93.54% 的 CoT 前缀预测选择第一个位置。条件匹配的线性探针从相同的隐藏状态中恢复了 78.94%,而自由生成恢复了 75.24%,这表明答案通常在前缀后仍然存在,并且立即读出失败。词汇和层诊断解释了这种不匹配:概率质量向连续标记移动,而答案信息在后面的层中仍然可以线性访问。这种影响在数据集和模型中会以不同的严重程度重复出现,但并不普遍。这些结果表明,CoT 前缀评分可能会将模型知识与评估界面不匹配混为一谈,除非请求的输出事件和评分的输出事件一致,否则应避免使用 CoT 前缀评分。