论文
SurgiQ:用于评估 大语言模型 中手术理解的大规模多领域基准
SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models
摘要
大语言模型 在手术中的可靠评估仍不完善。广泛的医学基准测试临床知识,而手术则需要程序推理、管理权衡、否定处理以及合理的手术决策中的选择。我们推出了 SurgiQ,这是一个纯文本、基于来源的基准,包含 13,055 个四选项多项选择题,涵盖六个外科领域和四种问题格式:基于案例、推理、最佳选项和否定。 SurgiQ 采用多阶段生成、验证和专家审核流程,由外科教科书、开放获取论文和考试材料构建而成。我们在统一的对数似然协议下评估 35 个开放权重 LLM。我们的结果显示了相当大的剩余空间:较小的模型通常保持在 25% 随机基线附近,而最佳模型达到 68.1% 的准确度。通用模型,尤其是 Qwen2.5,优于大多数生物医学模型,这表明当前的医学专业化尚未提供足够广泛的手术覆盖范围。校准和误差分析进一步表明,即使是强大的模型也会在临床上可能的干扰因素上犯错误,从而激发更可靠和更广泛的外科 LLM 评估。