论文

研究 大语言模型 分析糖尿病食谱的能力

Investigating the Ability of Large Language Models to Analyze Recipes for Diabetes

模型评测基准与评测资源

摘要

多项研究评估了 大语言模型 (LLM) 的膳食计划能力,并取得了积极的成果。这些模型可以处理自然语言输入,并利用从预训练中学到的知识来生成膳食计划。在这项工作中,我们研究了 LLM 分析给定糖尿病食谱的适用性的能力。 LLM的主要挑战是检索相关的糖尿病饮食指南,将食谱分解为成分和烹饪方法,并应用这些指南来确定食谱的适用性。为了研究这些挑战,我们采用了三种提示,即(i)直接查询提示(ii)上下文引导提示,以及(iii)包含来自医学来源的不同级别的糖尿病饮食指南的示例性上下文提示。我们引入了为本次调查策划的基准数据集,其中包含 7607 个食谱,其中包括 3807 个适合糖尿病的食谱和 3800 个不适合糖尿病的食谱。我们的结果表明,大多数 LLM 在预测适合的食谱以防止有害结果时持谨慎态度。此外,可以使用饮食指南进行推理的模型在预测糖尿病食谱的适用性方面表现更好。总体而言,Mistral-7B 和 Llama 70B 表现出了优于同类产品的性能。