论文
NoteVQA:来自真实用户社区的日常视觉问答基准
NoteVQA: Benchmarking VLMs on Real-Life Questions from Human Communities
摘要
视觉语言模型越来越多支撑面向消费者的AI搜索,但评估多样日常视觉问题仍困难。现有基准常针对多跳检索或长文综合等预设能力,而用户基于照片提问覆盖日常长尾情境。尽管模型进步,中国主流图像分享平台小红书用户仍向其他人求助。我们从这些问题整理NoteVQA,含252项、12个主题类别及7种用户意图。每项有从专家社区回复提炼的简洁参考,以及经人工审计、结合文字解释与支持图像的交错参考答案。我们分别评估短答正确性和交错回答质量,并为后者提出检索支持的单智能体ReAct框架AgenticInterleave,以及从内容、呈现和图像质量衡量参考及模型输出的十二维IVR-12准则。十个前沿模型中最高短答准确率52.8%,给Qwen3.5-397B-A17B增加智能体搜索只提高2.0%。同模型通过AgenticInterleave生成交错答案,IVR-12为3.52,人工审计参考4.65,最大差距在内容质量。结果显示日常视觉问题对准确性和有视觉依据的解释质量仍构成挑战。
