论文
SciCustom:大语言模型 中科学能力定制评估框架
SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
摘要
大语言模型(LLM)越来越多地应用于科学研究,但现有的评估往往无法反映实践中所需的细粒度能力。大多数基准测试都是手动策划的或领域通用的,限制了可扩展性以及与真实科学用例的一致性。在本文中,我们提出了一个名为 SciCustom 的新框架来解决这个问题。它支持根据大规模科学数据定制构建基准,以评估 LLM 中特定于应用程序的科学能力。 SciCustom 首先将科学知识组织成具有受控粒度的基于本体的知识单元,并训练标记器将大规模数据实例映射到该知识空间中。给定定制需求,通过基于投票的多模型共识来识别相关知识单元。这些单元通过二分搜索实现相关性感知基准检索,然后进行代理子集选择和基于数据的基准生成以进行有效评估。化学和医疗保健领域的实验表明,SciCustom 揭示了标准基准忽略的 LLM 科学能力的细粒度差异,同时既不需要专家注释,也不需要生成综合问题。这项工作为 LLM 中的科学能力基准测试提供了可扩展和应用程序感知的基础。源代码可在 https://github.com/yjwtheonly/SciCustom 获取。