论文

OmniFood-Bench:评估VLM的营养推理与个性化健康建议

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

模型评测基准与评测资源

摘要

大型视觉语言模型(VLM)快速整合进关键基础设施,有望革命化个性化医疗与饮食管理。但在食物系统领域,自主智能体面临独特而持续的挑战:视觉外观与内在营养构成之间的“系统性信息不对称”。既有基准主要聚焦粗粒度分类任务(如食物类别识别)——无法评估真实饮食管理所需的复杂推理链:特别是从识别隐藏食材到估计物理质量、再综合安全攸关医疗建议的穿越能力。本文引入OmniFood-Bench:从MM-Food-100K数据集构建的综合基准。与既往工作不同,OmniFood-Bench跨三项渐进能力评估VLM:基础感知(食材与烹饪方式)、定量推理(份量与营养分析)与安全攸关建议(疾病专属推荐)。我们评估六个最先进VLM——包括gpt-5.1、gemini-3-flash与qwen3-vl-8B。大量实验揭示惊人的“语义—物理差距”:模型在菜名识别上达到近人类准确率,却在质量估计上灾难性失败,并常为高风险糖尿病画像幻觉良性建议。本工作为部署于公共卫生的自主智能体建立可信度的严格标准。

OmniFood-Bench:评估VLM的营养推理与个性化健康建议:论文配图
图 1:从视觉识别到健康推理。传统的食物计算(上)主要侧重于对菜肴进行分类。 OmniFood-Bench(下)引入了一个分层评估流程,要求代理弥合“语义-物理差距”:从成分识别到定量重量估计,最后到个性化的、具有风险意识的医疗咨询。