论文

BAGEL:语言模型中动物知识专业知识的基准测试

BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

模型评测基准与评测资源

摘要

大语言模型 在广泛领域的知识和推理基准上表现出了强劲的表现,但目前尚不清楚语言模型在统一的闭卷评估协议下处理专门的动物相关知识的效果如何。我们引入了 BAGEL,这是评估语言模型中动物知识专业知识的基准。 BAGEL 由不同的科学和参考来源构建而成,包括 bioRxiv、Global Biotic Interactions、Xeno-canto 和 Wikipedia,结合使用精选示例和自动生成的闭卷问答对。该基准涵盖动物知识的多个方面,包括分类学、形态学、栖息地、行为、发声、地理分布和物种相互作用。通过专注于闭卷评估,BAGEL 测量模型的动物相关知识,无需在推理时进行外部检索。 BAGEL 进一步支持跨源域、分类组和知识类别的细粒度分析,从而能够更精确地表征模型强度和系统故障模式。我们的基准测试提供了一个新的测试平台,用于研究语言模型中特定领域的知识泛化并提高其在生物多样性相关应用中的可靠性。