论文
鲁棒文本引导开放词汇对象计数的测试时训练
Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting
摘要
文本引导的开放词汇对象计数 (TOOC) 可以对文本提示指定的任意对象类别进行计数,与传统的封闭集计数相比,提供了更大的灵活性。然而,现有的 TOOC 方法主要是在理想图像上开发和评估的,而现实世界场景经常遭受雨、雾、黑暗和传感器噪声等不利条件的影响,这严重降低了视觉质量并损害了视觉语言对齐。为了弥补这一差距,我们引入了 Robust-TOOC,这是第一个在不同腐败条件下评估 TOOC 的基准,它涵盖了六种代表性的退化类型:雨、雾、黑暗、高斯噪声、椒盐噪声和混合腐败。为了在保留原始计数架构的同时提高鲁棒性,我们提出了 Dual-TTT,这是一种用于 TOOC 的双架构测试时训练框架。具体来说,在测试时训练期间,Dual-TTT 仅更新文本引导的轻量级去噪模块(TL-Denoiser),同时保持原始计数网络冻结。受扩散模型的启发,TL-Denoiser 经过优化,可以在退化条件下从图像表示中消除腐败感知噪声。由于在测试时仅训练 TL-Denoiser,因此 Dual-TTT 无需注释,可以无缝集成到现有 TOOC 模型中,而无需修改其原始架构。对多个最近的 TOOC 基线的广泛实验证明了我们方法的有效性。