论文

多模态的几何增强部分估计 LLM

Geometry-Enhanced Portion Estimation for Multimodal LLMs

应用与实践视觉感知与空间理解

摘要

基于图像的饮食评估有望取代成本高昂、容易出现偏差的手动召回,但份量估计仍然是一个主要障碍。多模态 LLM (MLLM) 可以在不受控制的照片中零镜头识别多种食物,但它们在份量估计方面很弱——这是我们在当前前沿领域(Gemini、GPT 和 Claude 旗舰产品等)衡量的差距。我们提出了一种通过精确的部分头增强冷冻商业 MLLM 的方法:冷冻 DINOv2 主干上的小型几何增强网络,具有结构化的 softmax 所有权体积,消耗 MLLM 的每种食物名称、边界框和密度范围——没有深度传感器,没有 MLLM 微调。在三个现实世界基准上进行完全开放的词汇评估后,该头相对于单独的 MLLM,将每种食物的份量误差减少了 33-41%,优于每个旗舰 MLLM 的直接估计,并且在其自己报告的指标上超过了每个基准最初发布的仅图像模型。