论文
MM-VeriRec:用失败分类修复多模态推荐与拒绝决策
MM-VeriRec: Failure-Guided Fusion for Verifiable Agentic Multimodal Recommendation
摘要
图像往往包含文本元数据只能暗示的推荐约束:电影可能需要阴暗视觉,商品可能需要极简风格,视觉上不可能满足的请求则应被拒绝。Agentic多模态推荐器必须基于文本图像证据推理,判断何时视觉证据具有决定性,并在没有有效动作时放弃。我们提出MM-VeriRec,一个可验证多模态推荐协议与失败指导融合方法,针对隐藏视觉约束、图文不匹配及不可能任务的弃答。它从真实电影海报和商品图像数据构建任务,用确定性视觉属性验证每项推荐,将失败转为可操作标签:跟随文本陷阱、忽略视觉和错误接受。融合不应只是拼接模态,而应诊断哪个模态失败并路由至相应修复。在MM-ML 1M与Amazon Reviews上,更强文本和视觉嵌入改善检索,却不能消除这些失效;失败指导融合可以。自适应属性门读取与验证器相同的标签,其分数是与验证器对齐的上界,用于测试分类体系能否路由到正确修复。更有信息量的是非对齐门控下的迁移:独立导出的留一CLIP检测器仍达到0.7028与0.6111的视觉证据支撑成功率,高于VBPR基线和普通融合。文本与视觉差距在两个LLM家族中复现,而有效修复随领域变化。MM-VeriRec既是基准,也是可信Agentic多模态推荐的实用诊断闭环。