论文
驯服VLM中的思维链混淆:从机制证据到激活强制
Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement
摘要
强化学习(RL)提升视觉-语言模型(VLM)的推理能力,但可能诱发思维链(CoT)混淆:一种操作性、非意图性的结果——任务奖励或准确率上升,而推理轨迹变得更难溯源和监控。已有工作大多从行为层面记录这种退化,其表征层面的关联物和可操作的控制手段仍不清楚。我们发现模板关联激活与真实内容关联激活在 RL 期间变得难以区分,匹配干预支持所选特征对监控性退化的贡献。受此证据引导,我们提出 TAME(Targeted Anti-obfuscation with Mechanistic Enforcement),在 RL 期间使用稀疏自编码器(SAE)将行为反馈与对模板关联激活的定向抑制结合。其非对称约束只在模板激活超过 RL 前基线时施加惩罚,锚定局部化特征,而行为反馈促进有据可依的改进。在 VIRL-39k、SPA-VL 和两个模型家族上,TAME 使 CoT 监控性相对 GRPO 分别最高提升 30.9 和 16.7 个百分点。盲测人工评估显示两数据集上人类可监控性更高,两个保留的监控器家族复现了监控性增益。任务准确率变化小且方向不一,通用能力基准显示任务特定的权衡。这些结果为从行为监控走向表征级监督提供了路径,助力更可审计的 RL 训练多模态系统。
