论文
GPEC:用于心脏视频字幕生成的高效预大语言模型高斯过程嵌入校正
GPEC: Efficient Pre-LLM Gaussian Process Embedding Correction for Cardiac Video Caption Generation
摘要
多模态大语言模型 (MLLM) 在视频理解和字幕生成方面显示出强大的潜力,但其在超声心动图等专业医学成像领域的性能可能会下降。这项工作引入了高斯过程嵌入校正 (GPEC),这是一种模块化且计算高效的预 LLM 纠错方法,可改进 VideoChat2 用于心脏超声字幕生成的视觉表示。 GPEC 插入视觉投影层和语言模型之间,并学习残差校正,将投影的视觉表示移向注释引导的目标。通过将结构化视频注释转换为定性属性、生成固定格式的参考标题并将其映射到语言模型嵌入空间来构建目标。使用具有诱导点、自然参数变分更新和逐块线性内核的稀疏变分高斯过程对校正进行建模,而原始 VideoChat2 组件保持冻结。通过在相同的输入和参考条件下将原始 VideoChat2 与 VideoChat2 + GPEC 进行比较,使用表示级别、字幕级别、面向内容和执行时间指标来评估该方法。结果显示,应用建议的校正后,标题相似度和内容对齐得到了改善。此外,GPEC 在评估的设置中为每个视频增加了不到 0.05 秒的推理时间开销。这些发现表明,GPEC 可以以最小的计算成本改进专业医疗视频领域的字幕生成,而不需要对预训练的多模态主干进行端到端微调。