论文

NutriMLLM:用于膳食微量营养素分析的多模式 大语言模型

NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

模型训练合成数据

摘要

从食物图像中全面估计膳食微量营养素可以改善临床营养护理,但训练此类模型需要将不同食物连接到完整营养成分的大型多模式数据集。我们首先证明现有的多模式 大语言模型 (MLLM),包括领先的专有模型,对于这项任务来说是不可靠的。在五个模型系列和四个独立评估基准(ASA24、SNAPMe、FNDDS 和 NutriBench)中,模型经常放弃或返回统计上不可信的值。为了在无需昂贵的专家注释的情况下解决这一差距,我们将十年来人口规模的 24 小时饮食回忆重新用作文本到图像生成的结构化提示。该管道生成了约 110 万个图像-描述-营养三元组的合成语料库,每个三元组将生成的食物图像与完整的 65 种营养标签配对。据我们所知,这是最大的合成食品图像语料库,具有全面的微量营养素注释,计划在出版后公开发布。 微调 Qwen3-VL (2B/4B/8B/30B) 和 GLM-4.6V-Flash 在该语料库上生成了 NutriMLLM,这是第一个专门用于综合膳食微量营养素估计的视觉语言模型系列。我们用一个四部分框架来评估这些模型,该框架分别测量戒断、幻觉、整体可用性和每种营养素的数值准确性。在真实的食物图像上,每个 NutriMLLM 变体都几乎完全覆盖了所有 65 种营养素,并且最大的变体在大多数营养素的准确度上匹配或超过了专有基线(GPT-5、Gemini 3 和 Claude Sonnet 4.5)。这些结果表明,回忆驱动的综合监督可以使基于图像的综合微量营养素估计成为一个易于处理的工程问题,并支持膳食评估、个性化营养指导和人口规模的微量营养素监测。