论文
大语言模型 嗅觉评估基准
Benchmark for Assessing Olfactory Perception of Large Language Models
摘要
这里我们介绍嗅觉感知(OP)基准,旨在评估大语言模型(LLM)推理气味的能力。该基准包含 8 个任务类别的 1,010 个问题,涵盖气味分类、气味主要描述符识别、强度和愉悦度判断、多描述符预测、混合物相似性、嗅觉受体激活以及来自现实世界气味源的气味识别。每个问题都以两种提示格式呈现,即化合物名称和异构 SMILES,以评估分子表示的效果。通过评估主要模型系列中的 21 个模型配置,我们发现复合名称提示的表现始终优于异构 SMILES,增益范围为 +2.4 到 +18.9 个百分点(平均约 +7 个百分点),这表明当前的 LLM 主要通过词汇关联而不是结构分子推理来获取嗅觉知识。表现最好的模型总体准确率达到 64.4%,这凸显了嗅觉推理中的新兴功能和巨大的剩余差距。我们进一步评估了 21 种语言的 OP 子集,发现跨语言的聚合预测可以改善嗅觉预测,其中 AUROC = 0.86 为性能最佳的语言集成模型。 LLM 应该能够处理嗅觉而不仅仅是视觉或听觉信息。