论文
当科学矛盾在翻译中消失时
When Scientific Contradictions Are Lost in Translation
摘要
两项科学发现可以存在分歧,但不会相互矛盾。确定它们是否冲突需要知道它们是否描述了可比较的测量结果。我们研究语言模型在这个决策点的表现。在受控任务中,我们生成不可满足的 XOR 约束系统,并将其约束转化为来自不同实验室的科学报告。一项任务满足更多限制,而另一项任务满足更少但更好地匹配预期的生物学。这就造成了一个简单的困境:模型是选择最适合约束的分配,还是更符合生物学期望的分配?当直接说明约束时,GPT-5.6 Sol 和 Claude Opus 5 分别在 90% 和 96% 的情况下恢复最佳支持的分配。然而,在科学散文中,模型的表现有所不同。 Claude Opus 5 通常更喜欢生物学上预期的任务。消除生物学偏好将支持更好的分配的恢复率从 27% 提高到 79% (p<.001);当同样的生物学青睐的记录伴随着形式化请求和明确的配对设计提示时,恢复率达到 92% (p<.001)。 GPT-5.6 Sol 的敏感性较低,相应的变化均未达到统计显着性。这些结果表明,可靠的科学验证不仅取决于形式推理,还取决于模型如何决定应该比较哪些发现以及它们隐含的关系。