论文

重新评估波兰医学考试中表现出色的 LLM:真正的能力还是偏见驱动的表现?

Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

模型评测基准与评测资源

摘要

医学上的大语言模型(LLM)主要使用多项选择题回答(MCQA)进行评估,由于猜测策略和答案偏差,可能会高估真实的临床能力。为了解决这些限制,我们引入了一个基于波兰医学检查的扩展且更具挑战性的基准,添加了超过 15,000 个问题、两个新领域和四个结构修改,以减少 MCQA 特定的工件和更好的测试推理。我们评估 21 LLM 并表明评估设计对结果有很大影响。在我们更难的设置下,最佳模型 (Qwen3.5-122B) 在英语和波兰语考试中分别下降了 28.4 和 31 个百分点。尽管数据污染的证据很少,但标准 MCQA 分数并不能可靠地反映真实的医疗能力。为了促进进一步的研究,我们公开了我们的基准。