论文

PhySe-RPO:面向基于扩散模型的手术烟雾去除的物理与语义引导相对策略优化

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

模型训练强化学习

摘要

手术烟雾严重降低术中视频质量,遮蔽解剖结构并限制手术感知。现有基于学习的去烟雾方法依赖稀缺的配对监督和确定性修复流程,难以在真实手术条件下进行探索或强化驱动的改进。我们提出 PhySe-RPO,一个通过物理与语义引导相对策略优化(Physics- and Semantics-Guided Relative Policy Optimization)加以优化的扩散修复框架。其核心思想是将确定性修复转化为随机策略,从而实现轨迹级探索,并通过组相对优化实现无需评论家的更新。物理引导奖励约束光照与颜色一致性,而从基于 CLIP 的手术概念中学到的视觉概念语义奖励则促进无烟雾且解剖上连贯的修复。结合免参考的感知约束,PhySe-RPO 在合成与真实机器人手术数据集上产生物理一致、语义忠实且临床可解释的结果,为配对监督有限条件下的鲁棒扩散修复提供了一条有原则的路径。

PhySe-RPO:面向基于扩散模型的手术烟雾去除的物理与语义引导相对策略优化:论文配图
图 1:现有恢复方法的局限性:缺乏配对数据,恢复产生确定性输出,使得奖励学习变得困难,并且缺乏以除烟恢复为导向的奖励。我们的 PhySe-RPO 通过将恢复转变为随机策略优化问题并使用物理和语义引导的奖励来从未标记的真实手术视频中有效学习来解决这些问题。