论文
SCIRIGOR:评估最终分数之外的开放式科学分析
SCIRIGOR:Evaluating Open-Ended Scientific Analysis Beyond Final Scores
摘要
科学编码Agent会产生相互依赖的代码、结果、图示和主张,仅评估最终输出无法确定结论是否获得科学支持。我们提出有证据支撑的多模态科学分析任务,要求Agent产出可执行分析,并使主张得到同一次运行结果与可视化的支持。SciRIGOR框架和基准包含来自六个领域、17个子领域科学论文的100个案例。框架重建类型化证据图,区分产物保真度和关系有效性,对完整的主张支持路径评分,并定位最早缺乏支持的关系;基于原始来源的替代路径允许科学上等价的分析和可视化。我们评估11种Agent与模型配置。在完整基准运行中,主张与忠实及不忠实结果的一致率几乎相同,分别为91.8%和91.0%;但没有系统在软证据链评分上超过62.6%,严格整链成功率均不超过18.0%。结果表明内部自洽不等于科学正确,评估必须核查从数据到主张的完整支持链。
