论文
视觉搜索增强从产品视频中提取属性值的思想链推理
Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos
摘要
现有的视觉属性值提取(AVE)方法主要依赖于静态产品图像,无法捕捉时间线索、多角度视图和细粒度的视觉细节。由于缺乏领域知识,直接将视频视觉语言模型(VLM)应用于产品 AVE 会导致性能有限,并且 微调 它们需要大量的高质量数据和大量计算资源。因此,我们提出视觉搜索增强思想链推理(ViS-CoT),这是一种 无需训练 即插即用管道,可以轻松应用于电子商务中视频到文本 AVE 的任何开源视频 VLM。具体来说,ViS-CoT 采用视觉聚类来识别代表性帧,然后通过视觉搜索来检索语义相似的产品知识,从而丰富属性线索。接下来,交错式 CoT 推理模块通过源自字幕和自动语音识别的视觉对齐辅助文本迭代地完善推理。最后,整合的信息引导模型进行准确、细粒度的属性预测。 VideoAVE 数据集上 14 个产品类别的广泛实验表明,ViS-CoT 持续增强了多个最先进的视频 VLM,在 micro-F1 中实现了 17.91 个百分点的平均改进。