论文

C3-Bench:上下文感知更改字幕基准

C3-Bench: A Context-Aware Change Captioning Benchmark

模型评测基准与评测资源

摘要

虽然变化描述系统因应对不断变化的世界而受到广泛关注,但由于缺乏全面的评估框架,它们在不同的现实世界变化背景下的真实表现在很大程度上仍未得到探索。为了填补这一空白,我们提出了 C3-Bench,这是一个用于评估上下文感知更改字幕的综合基准。 C3-Bench 功能:(1) 4,996 个人工标记图像对,涵盖四个领域(例如自然场景、遥感图像、图像编辑和异常)的 51 个真实世界变化背景,每个图像对都具有源自多个以变化为中心的社区的各种精心策划的场景; (2) 变化描述任务中的第一个 LLM-as-Judge 评估框架,用于测量细粒度维度(例如,正确性、特异性、流畅性和相关性),以及探索模型是否以对称一致性理解变化的新颖可逆性指标。基于 C3-Bench,我们对 32 个模型进行了基准测试,包括传统的更改字幕模型、专有的大型多模态模型 (LMM) 和 2B-90B 开源 LMM。我们揭示了流行的变更描述范式中的一个基本盲点:一旦变更背景偏离训练式制度,传统模型就会崩溃,甚至像 GPT-5.2 这样最先进的 LMM 也会表现出系统性的领域和位置相关错误,从而扭曲可靠的变更理解。通过使这些隐藏的故障模式变得明确且可测量,我们描绘了构建可推广且值得信赖的变更字幕系统的下一个前沿。所有代码和数据集均可在项目页面上公开获取。