论文
CARVE:视觉证据的跨切片各向异性重新分配,以实现高效的 3D 医学体积理解
CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding
摘要
基于切片的 MLLM 通过将 3D 体积表示为 2D 切片序列来利用成熟的 2D 编码器。然而,这种切片公式会产生数千个视觉标记,给 LLM 主干带来负担,其中许多标记捕获相邻切片之间重叠的视觉证据。为了了解不断增长的视觉 词元预算 如何有效地提高性能,我们对两个 3D 医疗 VQA 基准进行了缩放分析,并发现收益递减:成本不断上升,而精度饱和,并且提高面内分辨率比在可比较的预算下添加切片更有效。因此,应该更有选择性地分配预算,而不是简单地扩大预算,但大多数词元压缩方法都是针对 2D 图像或视频设计的,其中冗余来自空间布局或时间运动,而不是来自沿深度轴的近乎重复的内容。我们提出了 CARVE,一个 无需训练 框架,它在 LLM 推理之前压缩视觉词元,并将词元减少转换为预算受限的 2.5D 分配。 CARVE 将深度轴划分为相干窗口,并根据标准化的跨切片证据非均匀地分配标记。在共享预算下,CARVE 在代表性切片上构建空间锚点,并从整个卷中检索局部变化的证据,然后将剩余的合格标记合并到每个窗口内的附近锚点中。 CARVE 删除了 Hulu-Med-7B 上大约 80% 的视觉标记,在每个 AMOS-MM 报告生成指标上领先于所有压缩基线,全标记质量保留率比最强基线高 6.2 个百分点,并在三个 VQA 基准测试中保留了 98.1% 的全标记性能。