论文

Hi-GaTA:用于生成手术视频报告的分层门控时间聚合适配器

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

应用与实践行业应用

摘要

外科手术的自动化临床医生级评估报告可以减轻文档负担并提供客观反馈,但由于难以将密集的时空视频表示与基于语言的推理相结合以及高质量、隐私保护数据集的稀缺,因此仍然具有挑战性。为了弥补这一差距,我们建立了一个基准,其中包含 214 个高质量模拟手术视频以及外科医生撰写的评估报告。在此资源的基础上,我们提出了一个用于生成手术视频报告的感知-对齐-推理框架,其特点是 Hi-GaTA,这是一种新颖的轻量级时间适配器,可通过短到长范围的时间聚合,有效地将长视频序列压缩为紧凑的、与 LLM 兼容的视觉前缀标记。为了获得强大的视觉感知,我们在 40,000 分钟的公共手术视频上对 Sur40k(一种手术专用的 ViViT 式视频编码器)进行预训练,以捕获细粒度的时空程序先验。 Hi-GaTA 采用具有文本条件双重交叉注意力的时间金字塔,并通过跨级门控融合和增加深度的策略来提高多尺度一致性。最后,我们使用 LoRA 微调 LLM 主干网,以便在有限的监督下生成连贯且风格一致的手术报告。实验表明,我们的方法实现了最佳的整体性能,与强大的 Multimodal 大语言模型 (MLLM) 基线相比具有一致的增益。消融研究进一步验证了每个提议组件的有效性。