论文
通过目标感知数据对齐进行细粒度食品图像理解
Fine-Grained Food Image Understanding via Target-Aware Data Alignment
摘要
细粒度的食物视觉语义理解需要模型捕捉成分、烹饪方法、熟度、颜色、质地和盘子成分之间的细微差别。尽管 CLIP 风格的视觉语言模型为这项任务提供了一个自然的框架,但当训练依赖于异构网络收集的图像-文本对时,它们的有效性受到限制。此类数据通常表现出网络与目标域之间的差距和跨模式错位,其中图像与目标分布不同,并且图像描述有噪声、多语言或视觉内容基础薄弱。我们提出了一种以数据为中心的多模态对齐方法,用于细粒度的食物描述和识别。我们的方法首先执行目标感知数据选择来识别视觉相关的训练子集,然后应用基于 VLM 的图像描述细化来生成基于视觉的目标风格描述。使用这些精心策划的图像-图像描述对,我们训练互补的 CLIP 式检索专家,并通过分层 VLM 辅助的多专家决策级融合策略进一步结合他们的决策,该策略仅在专家意见不一致时才调用 VLM。实验表明,我们的数据细化策略比单纯的网络监督显着提高了检索性能,仅基于 VLM 的图像描述细化就产生了约 19% 的平均性能增益。我们的完整方法还获得了比纯基于 VLM 的检索高出两倍以上的检索分数,同时保持了更高的效率。