论文

知识先于推理:用于大模型酶分类的无训练诊断基准 EC-Reason-Bench

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

模型评测基准与评测资源

摘要

酶功能预测是蛋白质功能分类的分层、知识密集型形式。现有的基准测试暴露了一个异常现象:一般的 LLM 通常能够正确地获得粗略的第一级,但一旦要求提供完整的 EC 数字,它们在第二级到第四级的精度就会下降到几乎为零,而专用模型和工具仍然可用。我们提出 EC-Reason-Bench,一种 无需训练 诊断评估协议,旨在回答两个问题:为什么一般 LLM 在 EC 数预测上的得分几乎为零,以及在不更新单个权重的情况下可以恢复多少损失。我们将酶的分类能力分解为四个正交杠杆,每个杠杆都可以单独测量:输出结构、外部知识、推理结构和推理鲁棒性。我们使用推理时间方法针对共享零样本基线来测试每个杠杆,再现之前报告的接近零的性能。通过几个强有力的推理 LLM 进行的实验产生了四个主要发现。首先,外部知识是决定性的,必须先于推理:一律较低的闭卷性能随着开卷访问而急剧上升,从而缩小了模型差距。其次,在封闭的环境中,级联和思维链是有益还是有害取决于模型的弃权倾向。第三,一旦证据可用,最佳 LLM 设置的总分与简单地投票最近检索到的邻居的 EC 编号是没有区别的;这种平局是平均的产物,它隐藏了对抗性证据的巨大增益,而多功能酶的同样巨大的损失。因此,对证据的推理充当了冲突邻居的仲裁者,而不是知识的来源,并且没有单一数字排行榜可以看到它。第四,准确性遵循同源可用性定律。