论文
ChemDIRT:稳健化学的多样化指令、表示和任务基准-LLM 评估
ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation
摘要
大语言模型 (LLM) 的快速发展导致人们对其在化学等科学领域的应用越来越感兴趣。然而,现有的化学基准通常仅提供模型能力的狭隘观点,专注于有限的任务集,而忽视了对问题表述和化学表示变化的鲁棒性。因此,报告的性能可能会高估模型在现实环境中一致推理的真实能力。为了应对这一挑战,我们引入了 ChemDIRT(多样化指令、表示和任务基准),这是一个综合评估框架,旨在评估 LLM 中化学推理的稳健性。 ChemDIRT 系统地测量了跨指令和分子表示变化的模型性能,同时涵盖八类化学任务。通过评估这些受控扰动下的准确性和一致性,ChemDIRT 提供了比传统单一格式基准更可靠的模型推理能力评估。我们对一组不同的开源和闭源 LLM 进行了基准测试,揭示了大量的提示敏感性、表示依赖性以及跨任务系列的不均匀性能。