论文
DRT:用于高效且扎实的多模态推理的密集推理跟踪
DRT: Dense Reasoning Trace for Efficient and Grounded Multimodal Reasoning
摘要
尽管多模态大语言模型(MLLM)取得了显着进展,但流行的思想链(CoT)范式仍然局限于自然语言表达空间。因此,它们本质上会产生过多的语言开销,导致信息稀释和视觉基础薄弱。为了应对这一挑战,我们提出了密集推理跟踪(DRT),这是一种偏离以自然语言为中心的 CoT 的范式,它将推理表达为紧凑的结构化跟踪,其中包括带有符号连接器的简洁中间状态,并将视觉观察与逻辑推论分开。首先,我们引入密集跟踪初始化,将 DRT 推理模式内化到模型中,在保留视觉证据的同时显着提高词元效率。为了进一步使模型能够忠实地捕获痕迹中的逻辑关系,我们提出了 Trace-Grounded 强化学习框架,该框架通过三视角验证管道构建参考痕迹,并采用具有结构化奖励的 Trace-Grounded GRPO,鼓励模型生成简洁的 DRT 式痕迹,减少幻觉并增强逻辑基础。在具有挑战性的推理基准上进行的大量实验表明,DRT 实现了 5.5$\times$ 的词元效率提升,同时比 Qwen3-VL 基线提高了 1.3 个准确度点。这些发现表明,复杂的多模态推理可能不需要详细的自然语言跟踪,为下一代 MLLM 开辟了一条更有效的道路。我们的代码和数据可在以下位置获取:此 https URL