论文

FoodCHA:面向细粒度食物分析的多模态LLM智能体

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

模型推理推理策略与问题分解

摘要

配备摄像头的移动设备和可穿戴设备的广泛采用使得可以方便地捕获膳食图像,使食物识别成为实时饮食监测的关键组成部分。然而,由于类内高度相似性以及单个图像中频繁出现多个食品,现实世界的食品图像面临着挑战。虽然深度学习模型在粗粒度分类方面取得了出色的性能,但它们通常很难捕获细粒度的属性,例如烹饪风格。此外,现代视觉语言模型中的开放式生成可以产生非规范标签,限制了它们的实际部署。我们提出了 FoodCHA,一个多模态代理框架,它将食品识别重新表述为分层决策过程。通过逐步锚定预测,FoodCHA 使用高级类别指导子类别识别,并使用子类别指导烹饪风格识别,从而提高语义一致性和属性级别区分度。为了确保实际可部署性,FoodCHA 采用紧凑的 Moondream-2B 视觉语言模型,该模型提供强大的推理能力,同时保持较低的计算和内存开销。 FoodNExTDB 上的实验表明,FoodCHA 在类别和子类别识别精度方面分别比 Food-Llama-3.2-11B 提高了 13.8% 和 38.2%,在烹饪风格分类精度方面实现了 153.2% 的惊人提升。

FoodCHA:面向细粒度食物分析的多模态LLM智能体:论文配图
图1:FoodCHA框架总览:分层锚定的食物识别决策流程。