论文

用于测试时自适应目标检测的奖励引导语义进化

Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection

模型推理推理搜索与路径规划

摘要

使用视觉语言模型 (VLM)(例如 Grounding DINO)的开放词汇对象检测在测试时间分布变化下会遭受性能下降,这主要是由于文本嵌入和区域建议的视觉嵌入变化之间的语义错位。虽然最近基于 VLM 的测试时自适应目标检测方法要么依赖于昂贵的反向传播,要么通过外部存储器绕过语义错位,但没有一种方法能够以 无需训练 方式直接有效地对齐文本和视觉。为了解决这个问题,我们提出了奖励引导语义进化(RGSE),这是一个 无需训练 框架,可以在测试时直接细化文本嵌入。受进化搜索的启发,RGSE 将文本嵌入适应视为语义搜索过程:它将文本嵌入作为候选变体进行扰动,通过与当前和历史高置信度视觉提案的余弦相似度作为奖励信号对其进行评估,并通过奖励加权平均将它们融合为精炼嵌入。无需任何反向传播,RGSE 即可在多个检测基准上实现最先进的性能,同时增加最小的计算开销。我们的代码将在发布后开源。