论文

CARVE:视觉证据的跨切片各向异性重新分配,以实现高效的 3D 医学体积理解

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

模型推理推理加速

摘要

基于切片的 MLLM 通过将 3D 体积表示为 2D 切片序列来利用成熟的 2D 编码器。然而,这种切片公式会产生数千个视觉标记,给 LLM 主干带来负担,其中许多标记捕获相邻切片之间重叠的视觉证据。为了了解不断增长的视觉 词元预算 如何有效地提高性能,我们对两个 3D 医疗 VQA 基准进行了缩放分析,并发现收益递减:成本不断上升,而精度饱和,并且提高面内分辨率比在可比较的预算下添加切片更有效。因此,应该更有选择性地分配预算,而不是简单地扩大预算,但大多数词元压缩方法都是针对 2D 图像或视频设计的,其中冗余来自空间布局或时间运动,而不是来自沿深度轴的近乎重复的内容。我们提出了 CARVE,一个 无需训练 框架,它在 LLM 推理之前压缩视觉词元,并将词元减少转换为预算受限的 2.5D 分配。 CARVE 将深度轴划分为相干窗口,并根据标准化的跨切片证据非均匀地分配标记。在共享预算下,CARVE 在代表性切片上构建空间锚点,并从整个卷中检索局部变化的证据,然后将剩余的合格标记合并到每个窗口内的附近锚点中。 CARVE 删除了 Hulu-Med-7B 上大约 80% 的视觉标记,在每个 AMOS-MM 报告生成指标上领先于所有压缩基线,全标记质量保留率比最强基线高 6.2 个百分点,并在三个 VQA 基准测试中保留了 98.1% 的全标记性能。