论文
GeoReward:减轻跨市场偏好预测的视觉语言模型中的上下文变量高估
GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction
摘要
视觉语言模型在许多多模态任务中表现出色,但仍然容易出现微妙但有影响力的失败模式:它们往往高估主要的视觉文本线索,同时低估稀疏但关键决策的上下文变量。这个问题,我们称之为上下文变量高估(CVE),在现实世界的应用中变得尤为明显,例如预测不同地理市场的广告图像偏好。例如,当要求 VLM 在针对不同国家/地区定制的两个产品图像之间进行选择时,它通常默认为一致的输出,而忽略 真值 的区域差异。这种崩溃的发生是因为普遍存在的大量信号,例如产品属性和密集的图像补丁,压倒了编码特定市场背景的少数但关键的词元。为了解决 CVE,我们首先收集了一个新的多模式数据集,其中包含真实广告创意及其在多个国家/地区的点击表现。然后,我们介绍 GeoReward,这是一种奖励模型,旨在预测不同地理市场的广告图像偏好。 GeoReward 集成了三种专门构建的机制:(1) 市场感知检索增强,(2) 上下文引导视觉调制,(3) 选择性灵敏度损失。此外,我们还演示了 GeoReward 如何指导 VLM 的 RL 的 微调 为文本到图像模型生成背景设计,从而生成具有市场意识的广告创意。实验验证我们的框架可以减轻 CVE 并优于现有基线。这项工作不仅诊断了 VLM 中对主导感知特征的系统偏差,而且还为稀疏上下文变量控制决策的应用程序提供了有针对性的解决方案。