论文
通过多模式食品验证和恢复改进基于图像的营养估算
Improving Image-Based Nutrition Estimation Through Multimodal Food-Item Verification and Recovery
摘要
当错过可见食物时,单图像营养估计可能会悄无声息地失败。即使正确识别了食物,其提议的区域也可能不支持份量估计。我们提出了一个框架,使用多模态大语言模型(MLLM)来盘点可见食物并单独验证食物身份以及每个提出的二维区域是否支持部分估计。一项整体图像审查使用这些验证结果来识别未解决的差距和遗漏的食物,最多触发一次有针对性的恢复通过。恢复的区域无需访问恢复提示即可重新验证,然后调整为最终项目集以进行营养评估。该框架不需要针对特定任务进行微调。对常见有效输出样本的匹配评估表明,项目级接地提高了所有测试设置的质量准确性和相对于调整后的检索基线的能量准确性,项目身份精度和召回率也有所提高,而恢复后视觉覆盖率在推理时单独评估,无需真值注释。