论文
Food-R1:具有强化学习功能的统一多任务食品视觉语言模型
Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning
摘要
最近的研究探索了用于食品分析的视觉语言模型(VLM)。然而,大多数现有方法主要依赖于有监督的 微调 (SFT),这通常限制推理和泛化能力。此外,高质量的大规模营养注释仍然稀缺。为了解决这些问题,我们推出了 CalorieBench-80K,这是一个带有精选卡路里标签和饮食建议注释的大型基准。据我们所知,这是第一个将思想链 (CoT) 注释纳入卡路里推理的食物图像基准。我们还提出了 Food-R1,这是一种在多任务学习范式中进行训练的统一食品 VLM,以使模型具备广泛的功能。 Food-R1 进行基于 CoT 的冷启动指令调整,然后使用组相对策略优化 (GRPO) 进行强化 微调 (RFT),以提高推理和性能。 CalorieBench-80K 和代表性基准的实验表明,Food-R1 在食品相关任务中始终优于强大的基准。代码、模型权重和基准注释可在项目存储库中找到。