论文
看似无关紧要的设计选择如何决定 LLM 在病理学中的性能
How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology
摘要
在评估全幻灯片图像 (WSI) 上的专门病理学模型时,通用 大语言模型 (LLM) 通常用作基线。由于 WSI 超出了当代模型上下文限制,LLM 基线通常使用通过多数投票独立处理的小型高放大倍数斑块,而没有对看似无关紧要的设计选择(例如斑块大小、斑块计数和放大倍数)进行系统评估。通才 LLM 一直表现不佳的专业系统,强化了这样的看法:特定领域的训练或架构适应对于涉及 WSI 的病理学任务是必要的。在这里,我们对四个输入设计因素进行了系统的因子分析:推理模式、补丁大小、放大倍数和补丁数量。我们证明,先前的研究通过选择非优化的输入配置夸大了专用模型和通用 LLM 之间的差距。在 MultiPathQA 基准上,切换到单一平衡配置(较低放大倍数下的大斑块,联合处理)可将 GPT-5 在癌症类型分类 (TCGA) 上的得分从 15.1% 提高到 39.5%,在器官分类 (GTEx) 上的得分从 38.1% 提高到 62.9%。每任务优化可进一步提升高达 43.9% (TCGA) 和 71.6% (GTEx) 的性能。相同的配置适用于另外两个模型和完全保留的 CPTAC 队列,无需任何特定于任务的调整即可将 Gemini 3 Flash 提高 23.4 个百分点。