论文

统计支持的 LLM 计算营养中的成分和配方数据收集

Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition

上下文与知识知识获取与更新

摘要

计算营养需要精确的成分数据,但当前的数据库不完整、不一致,并且是为人类参考而不是自动推理而构建的。 LLM 可以帮助填补这些空白,但单遍输出不可靠,并且可能会给下游计算带来静默错误。我们提出了一种用于成分数据采集的质量控制 LLM 管道,它结合了强大的统计估计、特定领域的不变检查和网络获取回退。适合 233 种食谱的说明性堆定律表明,独特成分的增长是次线性且超前的:独特成分与食谱的预计比率从 100 个食谱时的 1.74 下降到 5,000 个食谱时的 0.19。对于每个成分属性,重复的 LLM 查询被视为来自模型诱导的答案分布的样本,并且我们在数值、布尔、多项选择、开放分类和可选整数类型上应用稳健的点估计器和归一化置信度得分。不变的保护层强制每个成分记录中的营养和逻辑自我一致性。较小的数字不一致问题可以通过线性程序进行协调,该程序可以在保留语义零的同时最大限度地减少最坏情况的百分比偏差,并且重大违规行为会升级为基于网络证据的修复,然后仅在失败时进行人工审查。在精心策划的 30 种成分参考集上,该管道在营养标记上实现了 98.4% 的精确匹配,并将营养比例的中位绝对百分比误差从中位聚合基线的 31.9% 降低到 10.1%,减少了 21.8 个百分点,每种成分的 API 成本约为 1 美元。这将 LLM 辅助数据库构建框架作为受控数据工程工作流程,使不确定性可操作而不是丢弃它。