论文

LEAP:迭代科学设计中 LLM 的轨迹级评估

LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design

模型评测基准与评测资源

摘要

LLM 越来越多地部署在自主实验室中,假设它们的领域先验和迭代反馈推理使它们能够以比仅反馈基线更少的迭代次数收敛到良好的设计。然而,当前的迭代科学设计基准仅对固定范围内的结果快照进行评分。这使得学习轨迹无法测量,尽管该轨迹反映了学习效率,其中节省的每次迭代都真正节省了成本和时间。受此启发,我们研究了三种评估选择,这些选择改变了人们对迭代科学设计中的 LLM 学习效率得出的结论:测量什么、与什么基线进行比较以及以什么为基础。我们介绍了 LEAPBench(自适应过程中的学习效率),这是一个包含 55 个任务的框架,它将迄今为止最佳的曲线下面积 (AUC) 轨迹指标与经典贝叶斯优化参考和基于已发表文献的审计配对。应用于八个当代 LLM,从最终结果切换到轨迹评分改变了匹配范围内 53% 任务的最佳模型决策,并暴露了基于结果的评分所忽视的效率增益。 LLM 的性能并不优于经典贝叶斯基线。在 16 个生物任务中,预言机的奖励信号与已发布的最佳设计的配置一致,领域感知提示导致 LLM 选择与已发布的最佳设计匹配,比第 30 次与领域无关的提示匹配的频率大约低 10 个百分点。该模式在 6 个任务上最清晰,其中文献典型配置和已发布的最佳配置存在差异,而与领域无关的提示在所有任务上与已发布的最佳配置匹配的频率更高。 6. 轨迹指标还可以作为易于处理的训练目标。以指标作为奖励的离线强化学习提高了 21 项保留任务中 14 项的表现。