论文
思维模型中的实时视觉归因流
Real-Time Visual Attribution Streaming in Thinking Model
摘要
我们提出了一个用于多模态思维模型中实时视觉归因流的摊销框架。当这些模型从屏幕截图生成代码或从图像解决数学问题时,它们的长推理轨迹应该以视觉证据为基础。然而,验证这种依赖性具有挑战性:忠实的因果方法需要昂贵的重复向后传递或扰动,而原始注意力图提供即时访问,但它们缺乏因果有效性。为了解决这个问题,我们引入了一种摊销方法,该方法学习直接根据注意力特征中编码的丰富信号来估计语义区域的因果效应。在五个不同的基准和四个思维模型中,我们的方法实现了与详尽因果方法相当的 忠实性,同时实现了视觉归因流,用户将基础证据作为模型原因而不是之后观察。我们的结果表明,多模态思维模型中的实时、忠实归因可以通过轻量级学习而不是强力计算来实现。