论文
当思想链适得其反时:评估医学语言模型中的提示敏感性
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
摘要
大语言模型 (LLM) 越来越多地部署在医疗环境中,但它们对提示格式化的敏感性仍然很少被表征。我们通过一系列广泛的稳健性测试,在 MedMCQA(4,183 个问题)和 PubMedQA(1,000 个问题)上评估 MedGemma(4B 和 27B 参数)。我们的实验揭示了一些令人担忧的发现。与直接回答相比,思维链 (CoT) 提示的准确性降低了 5.7%。 Few-shot 示例使性能降低 11.9%,同时位置偏差从 0.14 增加到 0.47。改变答案选项会导致模型在 59.1% 的情况下改变预测,准确率下降高达 27.4 个百分点。将上下文前截断到 50% 会导致准确率骤降至无上下文基线以下,但后截断却保留了 97% 的全上下文准确度。我们进一步表明,完形填空评分(选择最高对数概率选项标记)达到了 51.8% (4B) 和 64.5% (27B),超越了所有提示策略,并揭示了模型比其生成的文本显示的“知道”更多。排列投票比单序推理恢复了 4 个百分点。这些结果表明,在通用模型上验证的即时工程技术不会转移到特定领域的医学 LLM,并且存在可靠的替代方案。