论文

Slot2Text:以对象为中心的视觉标记化,实现高效且空间可追踪的外科 MLLM

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

模型推理推理加速

摘要

用于手术场景理解的多模态 大语言模型 (MLLM) 通常会在语言模型中注入数百个密集的视觉标记,从而导致推理成本高昂,并且生成的答案的空间可追溯性有限。我们提出了 Slot2Text,这是一种双模式外科 MLLM,它用一组编码为时隙潜伏的紧凑区域来取代视觉输入的密集表示。 Slot2Text 没有依赖视觉编码器与语言的对比对齐,而是将自监督视觉特征分组到几个区域中,这些区域被语言模型用作区域标记的视觉标记。 Slot2Text-Fast 使用槽前缀来回答外科问题。 Slot2Text-Reason 还可以识别和定位与推理相关的区域,将语言输出链接到相应的槽标记、掩码或区域。对多个视觉问答和视觉基础基准的实验表明,Slot2Text-Fast 以低得多的成本与最先进的基线竞争,将平均总词元消耗减少了 91.8%,视觉前缀从 1,295 个词元减少到 47 个词元(减少了 96.4%)。 Slot2Text-Reason 用额外的词元和延迟来换取明确的区域身份、位置和可追踪的空间证据。这些结果将紧凑的槽潜伏建立为外科 MLLM 的有效默认视觉界面,并在需要更大的空间可追溯性时调用扎根推理。