论文

OliveGemma:用于识别地中海和欧洲饮食的 30 亿视觉语言模型

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

模型训练监督微调与指令调优

摘要

基于图像的饮食评估为自我报告的食物日记提供了一种可扩展的替代方案,但由于班级内的高变异性和视觉上相似的菜肴,细粒度的食物识别仍然具有挑战性。这项研究提出了 OliveGemma,一种用于识别和推理地中海和欧洲美食的视觉语言模型。 OliveGemma 基于开放权重的 PaliGemma-2-3B 架构构建,在来自三个欧洲研究项目数据集(MedGR、ODIN 和 VIPPSTAR)的 17,340 张图像的统一语料库上与 LoRA 进行了微调,协调成由 216 个组成的菜肴类别组成的词汇表,并与 102,642 个指令式问答项目配对,涵盖菜肴识别、可能和可见成分、类别边界辨别、视觉证据和整体视觉食物的理解。在三倍交叉验证方案下,OliveGemma 实现了 92.96% +/- 0.91% 的 top-1 准确率,超过最强的 CNN 基线 (DenseNet-121) 7.31%,并且比具有精确指令和有界类(包括 Gemini Flash 3 和 3.5、GPT-5.4 Mini 和 Claude Haiku 4.6)的零样本前沿模型高 8%,分别为 46% 和 64%。此外,OliveGemma 在 Top-3 和 Top-5 准确率方面表现出有竞争力的性能,在 CNN 和前沿模型中排名第二,仅次于 DenseNet-121。此外,OliveGemma 对食品类别的可能成分实现了 90.79% +/- 1.3% 的精确设定。这些结果表明,小型 VLM 的 PEFT 适应可以在专门的食品识别方面超越更大的专有模型。该模型可在 https://huggingface.co/JamesZar/OliveGemma-3B 上公开获取,实验和结果可在 https://github.com/tsiokris/OliveGemma 上找到。