论文

MolQuest:化学结构解析中归纳推理的代理评估基准

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 在推进科学发现方面具有巨大的潜力,但对其在现实世界研究中的动态推理的系统评估仍然有限。当前的科学评估基准主要依赖于静态的单轮问答(QA)格式,这不足以衡量需要多步迭代和实验交互的复杂科学任务中的模型性能。为了解决这一差距,我们引入了 MolQuest,这是一种基于真实代理的新型评估框架,用于基于真实的化学实验数据来阐明分子结构。与现有数据集不同,MolQuest 将分子结构阐明形式化为多轮交互任务,要求模型主动规划实验步骤、集成异构光谱源(例如 NMR、MS)并迭代完善结构假设。该框架系统地评估了LLM在广阔而复杂的化学空间中的溯因推理和战略决策能力。实证结果表明,当代前沿模型在真实的科学场景中表现出显着的局限性:值得注意的是,即使是最先进的 (SOTA) 模型也只能达到约 50% 的准确度,而大多数其他模型的性能仍低于 30% 的阈值。这项工作为面向科学的 LLM 评估提供了一个可重复和可扩展的框架,我们的研究结果突出了当前 LLM 战略科学推理中的关键差距,为未来能够积极参与科学过程的人工智能研究奠定了明确的方向。