论文

Photon:通过高效的多模态加速体积理解 大语言模型

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

模型推理推理加速

摘要

多模态 大语言模型 对于临床视觉问答任务很有前景,但高计算成本阻碍了扩展到 3D 成像。先前的方法通常依赖于 2D 切片或固定长度的词元压缩,破坏体积连续性并模糊微妙的发现。我们提出了 Photon,一个用可变长度的标记序列来表示 3D 医学体积的框架。 Photon 引入了指令条件词元调度和代理梯度传播,以在训练和推理过程中自适应地减少词元,从而降低计算成本,同时减轻冗余词元造成的注意力稀释。它结合了自定义反向传播规则和梯度恢复,以在离散词元下降的情况下实现可微优化。为了稳定词元压缩并确保视觉证据的可靠使用,Photon 进一步应用了正则化目标,以减轻仅语言偏差并提高可靠性。对各种医学视觉问答任务的实验表明,Photon 实现了最先进的准确性,同时减少了资源使用并加速了训练和推理。