论文
SCICONVBENCH:评测LLM在计算科学任务制定中多轮澄清能力的基准
SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science
摘要
大语言模型(LLM)正被越来越多地部署为科学AI助手,越来越多的基准从知识检索、推理、代码生成和工具使用等方面评估其能力。然而,这些评估通常假设科学问题已经被恰当地提出,而实际的科学辅助往往始于一个定义不良的用户请求,必须先通过对话加以细化,才能可靠地开展任何计算、分析或实验。我们提出SCICONVBENCH,一个面向科学任务制定多轮澄清的基准,涵盖四个计算科学问题领域:流体力学、固体力学、材料科学和偏微分方程(PDE)。SCICONVBENCH针对两种互补能力:引出缺失信息(消歧),以及检测并纠正包含内部矛盾信息的错误请求(不一致性消解)。我们的基准将结构化任务本体与基于量规的评估框架相结合,可从澄清行为、对话依据和最终规范保真度三个维度系统地测量LLM性能。当前前沿模型在不一致性消解上表现相对较好,但即便是最佳模型,也只能解决流体力学中52.7%的消歧案例。我们进一步发现,前沿LLM频繁做出未明说的假设,并执行不以与用户对话为依据的隐式规范修复。SCICONVBENCH为评估可靠计算科学助手所需的上游对话推理奠定了基础。代码与数据可在 https://github.com/csml-rpi/SciConvBench 获取。
