论文

TasteBench:从分子到食品的多模态感官预测基准

TasteBench: Multimodal Benchmark for Sensory Prediction, from Molecules to Sustainable Foods

模型评测基准与评测资源

摘要

可持续蛋白发现缺少类似分子对接或密度泛函理论的快速计算代理;判断新食品是否像动物性目标,需要昂贵人工感官小组,成为设计—构建—测试循环的瓶颈。我们提出TasteBench,一个多模态基准与隐私保护竞赛,包含两项任务:食品级排序基于24类215种植物性食品的2.1万余次人工评估,形成935组类内排序对;辅助分子级味觉分类覆盖1.5万味觉分子。为严格解释表现,我们刻画金标:评委间一致性低,Krippendorff alpha为0.077,聚合排序的折半可靠性上限为0.825,界定应评价机器学习系统的范围。我们比较四种输入模态基线,在评委评价的相同配对上,最佳模型配对准确率0.661,可与个人评委中位数0.650竞争,在全部类内配对上为0.683。TasteBench提供评估基础设施与基线,衡量可持续蛋白发现计算筛选的进展。