论文

SCIRIGOR:评估最终分数之外的开放式科学分析

SCIRIGOR:Evaluating Open-Ended Scientific Analysis Beyond Final Scores

智能体系统Agent任务评测

摘要

科学编码Agent会产生相互依赖的代码、结果、图示和主张,仅评估最终输出无法确定结论是否获得科学支持。我们提出有证据支撑的多模态科学分析任务,要求Agent产出可执行分析,并使主张得到同一次运行结果与可视化的支持。SciRIGOR框架和基准包含来自六个领域、17个子领域科学论文的100个案例。框架重建类型化证据图,区分产物保真度和关系有效性,对完整的主张支持路径评分,并定位最早缺乏支持的关系;基于原始来源的替代路径允许科学上等价的分析和可视化。我们评估11种Agent与模型配置。在完整基准运行中,主张与忠实及不忠实结果的一致率几乎相同,分别为91.8%和91.0%;但没有系统在软证据链评分上超过62.6%,严格整链成功率均不超过18.0%。结果表明内部自洽不等于科学正确,评估必须核查从数据到主张的完整支持链。

SCIRIGOR:评估最终分数之外的开放式科学分析:论文配图
图1:SciRigor基准构建流程。开放获取研究只有经过图级证据闭合、任务标准化、两次独立的完整重建及专家审计后,才进入基准。Agent可见任务与评价侧的标准产物、评分约束和支持路径相互分离。