论文
VIG:视觉信息增益作为多模态思想链压缩的奖励信号
VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression
摘要
多模态大型推理模型通常依赖于长的思想链 (CoT) 轨迹,其中很大一部分标记(例如重复的视觉描述、自我反思和其他与视觉无关的填充物)会增加推理成本,而对答案没有贡献。现有的 CoT 压缩方法优化了输出长度,但从未测量推理标记是否真正扎根于图像中。我们提出 \textbf{VIG} (视觉信息增益),这是一种信息论 GRPO 奖励,根据图像减少其预测不确定性的程度对每个推理标记进行评分。 VIG 是根据同一策略的两次前向传递在线计算的,一次有图像,另一次没有图像,因此不需要参考链、外部注释或辅助奖励模型。在六个主要的多模态推理基准和三个 Qwen3-VL-Thinking 模型大小 (2B/4B/8B) 以及对 8B 的额外 R1-Onevision-Bench 评估中,VIG 不断提高准确性与效率的权衡,支持我们的中心主张:\emph{高效的多模态推理源于提高视觉信息密度,其中每个推理标记通过锚定到图像而不是强加长度预算来赢得自己的位置。}我们的源代码可以在 https://github.com/chaser682/vig 上找到。