论文

NutriBench-Kitchen:营养管理的人工智能基准测试

NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management

模型评测基准与评测资源

摘要

一名具体的厨房助理必须做的不仅仅是识别孤立框架中的食物。它必须随着时间的推移跟踪成分状态,并将视觉观察与食谱和营养知识相结合,以支持约束感知决策。我们将这种能力正式化为\emph{体现营养管理}:感知营养相关事件,维持持久的食物状态,并将其用于基于知识的规划。现有的基准评估静态食物理解或具体烹饪动作,但没有衡量智能体是否可以在动态厨房中持续更新和使用营养相关状态。为了填补这一空白,我们引入了 \textbf{NutriBench-Kitchen},这是一个包含来自 160 个烹饪视频的 1,500 个手动验证的问答对的基准测试。它涵盖五个任务系列:成分输入、内存管理、食谱查询、长期规划和短期规划,涵盖不同规划范围内的食品状态构建、维护、知识检索和决策。对专有和开源大型视觉语言模型的评估揭示了与人类表现的巨大差距,特别是在定量成分估计、长期状态跟踪和相互作用约束下的推理方面。我们进一步介绍了 \textbf{Nutri-Vgent},一种具有独立情景、食物状态和食谱记忆的诊断长视频代理。其持续改进证明了明确的状态表示和结构化记忆对于营养管理的价值。 NutriBench-Kitchen 和 Nutri-Vgent 共同提供了一个测试平台,用于研究动态厨房中的持久状态跟踪和基于知识的推理。代码可在 https://github.com/V1ol1n/NutriBench-Kitchen 获取。