论文

PHREEQC-MCQ-200:面向工具增强科学仿真器智能体的诊断基准

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

智能体系统Agent任务评测

摘要

大语言模型智能体日益连接到科学软件——但工具访问何时使科学计算更可靠而非仅仅更复杂——仍不清楚。我们介绍PHREEQC-MCQ-200——评估工具增强智能体在确定性水溶液地球化学模拟上表现的基准。该基准包含从21个经验证的PHREEQC场景导出的200道多选题——要求智能体构造模拟器输入、执行PHREEQC、检查结构化输出并提交最终答案。跨多个前沿与中端模型家族——模拟器访问大幅提升聚合准确率——确认有据执行对许多科学计算任务是必要的。但增益并非单调:工具增强智能体也会答错它们在无工具时答对的题目——揭示单看平均准确率会隐藏的退化。我们进一步表明输出访问协议很重要。目录式界面可降低token成本——同时对更强模型保持或提升准确率——但对无法可靠导航结构化模拟器输出的中端模型则降低性能。因此PHREEQC-MCQ-200将科学工具使用框定为端到端诊断问题——而非简单的工具调用能力。我们主张科学智能体评估不仅应报告准确率——还应报告逐题保持率、输出访问敏感性、轨迹失败与计算链断裂之处。

PHREEQC-MCQ-200:面向工具增强科学仿真器智能体的诊断基准:论文配图
图 1:Agent-TOC 协议下的 PHREEQC-MCQ-200 代理工具。