论文
通过基于数字孪生表示的强化学习来训练 LLM,以实现推理密集型手术视频 QA
Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA
摘要
手术视频问答需要跨语义、空间和时间维度的多步骤推理。现有方法在架构上将视频压缩为离散的标记表示,并将视觉感知与推理结合起来。这种方法分割了连续的时空关系,并已被证明会限制多步推理能力。我们引入了强化学习(RL)框架,该框架训练 大语言模型 (LLM)通过操作由手术基础模型构建的数字孪生表示来将感知与推理分离。此外,我们还引入了跨帧、时间窗口和过程级别的分层表示以及概率不确定性估计。最后,我们提出了一种新颖的奖励,通过临床合理性评估和训练的不确定性感知校准将格式验证与准确性评估结合起来。为了展示这种方法的功能,我们引入了 REAL-Colon-Reason,这是一个结肠镜基准测试,包含三个复杂级别的 2000 个问答对。我们在 REAL-Colon-Reason 和两个现有的外科 VideoQA 基准 REAL-Colon-VQA 和 EndoVis18-VQA 上实现了最先进的性能。