论文

XDomainBench:诊断高维科学知识组合中的推理坍塌

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

模型评测基准与评测资源

摘要

大语言模型(LLM)日益被部署用于知识综合,但其在科学知识上的组合泛化能力仍未被充分刻画。现有基准主要聚焦单轮受限场景,未能捕捉真实世界交互式科学工作流所暴露的能力边界。为此,我们提出XDomainBench,一个面向交互式跨学科科学推理的诊断基准。我们形式化了组合顺序与混合结构,以支持从单学科到跨学科的系统化压力测试,涵盖20个领域、4个任务类别共8,598个交互会话,并以8种覆盖难度与领域混合动态的现实轨迹模式模拟真实的AI4S场景。对LLM的大规模评估揭示,随着组合阶数增加会出现系统性推理坍塌,其根源有二:(i)领域组合直接导致的难度提升;(ii)交互放大的间接失败,即轨迹模式触发误差累积、推理中断与领域混淆,最终导致会话坍塌。

XDomainBench:诊断高维科学知识组合中的推理坍塌:论文配图
图 2:XDomainBench 框架概述。该框架生成跨 20 个领域和 4 个任务原型的多轮轨迹,并用诊断信号进行注释以评估推理的稳健性。