论文

智能体能给反应定价吗?在化学成本推理上评测LLM

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体系统Agent任务评测

摘要

大语言模型(LLM)作为工具使用代理的能力越来越强,其基准涵盖了各种一般代理任务。然而,对科学工具使用的严格评估仍然有限。在化学领域,最近的代理可以计划合成并调用特定领域的工具,但评估通常依赖于策划的演示、专家评估或LLM作为法官的评分,而不是精确的、无需法官的基本事实。我们通过化学品采购成本估算来解决这一差距,这是一项实际任务,代理商必须根据化学品身份、检索供应商报价、选择有效的可购买包、标准化数量并根据反应描述计算成本。我们推出了 ChemCost,这是一个包含 1,427 个可评估反应的基准,基于涵盖 2,261 种化学品和 230,775 个供应商报价的冻结定价快照,支持标量评分和基础、检索、采购和算术故障的阶段级诊断。为了评估鲁棒性,我们进一步构建了受控的噪声注入视图,这些视图会扰乱化学别名、数量表达式、缺失字段和输入格式。对前沿、开放式和化学专业LLM代理的实验表明,工具访问是必要的,但不足以解决任务。在干净的输入上,最强的代理只能达到 50.6% 的准确度,相对误差在 25% 之内,并且在真实噪声的情况下会大幅降低。阶段级分析进一步表明,失败源于脆弱的解析、无效的证据集成、无效的包选择和不收敛的工具使用。

智能体能给反应定价吗?在化学成本推理上评测LLM:论文配图
图1:采购成本估计任务总览与代表性失败模式(落地/检索/算术)。