论文

SciTrue:在NTCIR SciClaimEval任务中利用前沿与开放语言模型可靠验证科学主张

SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task

模型评测模型能力评测

摘要

我们描述了 SciTrue 团队参与 NTCIR-19 SciClaimEval 任务 ~\cite{sciclaimeval} 的两个子任务,该任务要求系统根据论文的表格和图表验证科学主张。我们不是调整单个模型,而是在一个诚实的、每个样本的协议下对 11 个前沿和开放的多模态模型进行基准测试,并将它们与轻量、透明的后处理相结合。在官方盲测排行榜(Section~\ref{sec:results})上,SciTrue 在四个证据类别/子任务组合中的三个中以明显优势排名第一,并在第四个主要指标上并列第一。三项发现解释了这一结果。首先,强大的指令调整模型已经具有竞争力:Claude Opus~4.8 和 Gemma-4-31B 均超过了最强的公共基线 (o4-mini),GPT-5.5 和 Claude Fable~5 领先这两个子任务(Subtask~2 上的 97.7)。其次,任务的配对结构是最大的杠杆:\emph{无泄漏对先验},它仅从声明文本(可见字段)中恢复支持/驳斥配对,并将支持分配给置信度更高的证据,将子任务 1 的配对准确度从 72.2 提高到 93.5,远远超过任何模型交换或集成权重。第三,逐案审核发现,大多数残留错误是视觉上无法检测到的标签映射交换或数据集标签噪声,因此测量的准确性低估了真实能力,并且可通过建模修复的余量很小。受控微调、蒸馏和代理一致性检查支持相同的结论,并且我们记录了整个测量泄漏(通过数据打包而不是其内容到达系统的标签信息),其中发布的文件排序对标签进行编码,包括短暂误导我们自己的管道的一个实例。

SciTrue:在NTCIR SciClaimEval任务中利用前沿与开放语言模型可靠验证科学主张:论文配图
图2隐性图例交换( pair val_fig_0154/0155, 格式坚固的雷达图表) 。顶部: 原始图表( 金支持) ; 省略几何相同的篡改副本 。底部:图例缩放 - orange是 SemEval2017, 原版为SciDocsRR, 但被篡改的复制件( 红箱) , Python / Bullet 轴标签同样被替换 。点不会移动,因此重新标签不会留下几何痕迹,所有三种组合模型都给两个成员指定了相同的标签——一个真正的上限,而不是认知错误。