论文

ProCap:突出引导的对象校正,实现忠实且全面的视频描述

ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

模型推理推理验证与自校正

摘要

提高视频描述质量通常需要重新训练大型视觉语言模型,这是一项昂贵且往往不切实际的要求。现有的 无需训练 替代方案在检测到的对象中使用地面标题来抑制幻觉,但仅应用单个固定校正通道,而不优先考虑哪些对象最重要,从而省略了语义上重要的内容。我们提出了一种突出感知的迭代事后纠正框架,该框架在不修改底层视频描述模型参数的情况下克服了这两个限制:轻量级评分机制通过空间显着性、时间持久性和关系动态对检测到的对象进行排名,而迭代的、提示驱动的细化循环使用此排名在多轮中逐步将缺失但上下文相关的对象注入到描述中。我们使用基于对象的自动指标、110 名参与者的人体研究以及与 ChatGPT 和 Gemini 的定性比较来验证 MSVD 和 MSR-VTT 的框架;在人类评估中,相对于强大的预训练描述基线,该框架将感知完整性提高了 48%,并将幻觉减少了 45%,所有这些都无需重新训练或参考描述。这些结果将显着性引导的迭代纠正定位为一种轻量级、可扩展且与模型无关的途径,可实现更完整、更值得信赖的视频描述,与可访问性、检索和其他多媒体理解应用程序直接相关。