论文

实验还是结果? 大语言模型 探索科学可行性

Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models

模型评测模型能力评测

摘要

科学可行性评估询问某个主张是否与既定知识一致,以及实验证据是否可以支持或反驳它。我们将可行性评估视为一项诊断推理任务,其中,在给定假设的情况下,模型预测可行或不可行,并证明其决策的合理性。我们在受控知识条件下(仅假设、实验、结果或两者)评估 大语言模型 (LLM),并通过逐步删除实验和/或结果上下文的部分来探讨稳健性。在多个 LLM 和两个数据集中,提供结果证据通常比提供实验描述更可靠。结果往往会提高准确性,超出内部知识本身所能提供的范围,而实验文本可能很脆弱,并且在上下文不完整时可能会降低性能。这些发现阐明了实验证据何时有益于基于 LLM 的可行性评估以及何时引入脆弱性。