论文
ORCA:用于 无需训练 3D CT 视觉词元压缩的器官质心聚合
ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression
摘要
输入视觉语言模型的 3D CT 扫描会产生一长串视觉标记,通常每卷有数千到数万个,并且必须先压缩该序列,然后语言模型才能使用它。词元压缩在一般视觉领域得到了很好的研究,但很少专门针对 3D CT。一种常见的基线是网格平均值,它汇集了规则的网格单元,并且可以将不同的解剖结构、病变和空气混合成一个标记。我们提出了 \textbf{ORCA} (ORgan-Centroid Aggregation),一个 3D CT 的词元压缩器。它将相邻标记与器官引导合并,并添加每个区域质心的正弦编码以保留空间布局。这保留了下游模型所需的解剖信息。 ORCA 是 无需训练,即插即用,无需任何模型更改或文本查询即可生成可调整的词元集。我们通过两个数据集(CT-RATE 和 Merlin)和五个编码器对其进行评估。评估涵盖两种任务类型:五个系列的属性预测(大小、密度、位置、纹理和疾病)和文本生成(视觉问答和报告生成)。在匹配的 词元预算 中,ORCA 比现有压缩方法持续改进。它将视觉上下文缩小了 $64\times$,将 KV 缓存缩小了 $50\times$,并且处理每个卷的速度提高了 $31\times$。代码发布于https://github.com/renjie-liang/ORCA-3DCT。