论文
克劳德寓言5解决生物医学挑战问题的能力
Capabilities of Claude Fable 5 on Biomedical Challenge Problems
摘要
前沿语言模型越来越多地根据生物医学基准进行评估,但有两个问题破坏了大多数已发表的评估:遗留基准接近饱和,以及开放式回答由其他语言模型评分。我们评估了 Claude Fable 5(Anthropic 最强大的公开可用模型),涵盖八个生物医学基准、四个文本和四个多模态,全程使用针对固定答案键的确定性评分。我们将两位 Claude 前辈和 GPT-5 作为基线。拒绝作为每个结果表中的不同结果进行跟踪。这一决定产生了该论文的核心发现。根据基准测试,《神鬼寓言 5》拒绝了 8.0% 到 99.4% 的问题,这种模式在前作和 GPT-5 中都没有。一旦被拒绝的项目被排除在分母之外,《神鬼寓言 5》的准确性就超过或达到本研究中每个基准的所有其他模型。我们确定了两种可区分的拒绝模式:一种专注于 MedQA 和 MedXpertQA MM 的基础科学和机制内容,使用每个基准自己的类别标签在两个基准上独立确认; RareBench 上有一个单独的疾病领域模式,其中先天性代谢疾病的表现几乎被普遍拒绝,而成人发病的自身免疫性疾病的表现则不然。 《神鬼寓言 5》生物医学用途的主要限制是参与的意愿,而不是参与后的能力。