论文

临床LLM中证据充分性提示的裁判依赖安全增益与模型特定有用性代价

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

模型评测安全与风险评测

摘要

背景:LLM裁判日益被用于为临床语言模型在证据不全时的过度自信答案打分,但测得的“安全增益”究竟反映真实行为改变还是裁判自身的校准,仍未解决。以结构化证据充分性提示为测试用例,我们追问:它是否减少不安全的过度自信回答;该效应在多大程度上取决于打分裁判;以及它在有用性上的代价。方法:在回顾性公开数据基准(Real-POCQi、HealthBench、MedRBench)上,四个模型(GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3)以标准提示与包装器回答完全配对的公共题板(1,200格)。预定终点是由主裁判(GPT-5.4-nano)打分的不安全过度自信配对降幅;次要分析加入异族裁判(Claude Sonnet 5)、正确性裁判、匹配的脚手架对照与盲法三临床医生评审。结果:不安全过度自信从49.3%降至24.7%,配对降幅24.7个百分点(95% CI 21.8–27.7;p<0.001),方向跨模型与改写稳健。但幅度依赖裁判:Sonnet在方向上一致却几乎把效应减半(+13.1分),且分歧是单向的。盲法临床医生把主裁判定性为高敏感(1.00)低特异(0.55)的筛查器,而非校准的比率。安全增益伴随模型特定的有用性代价(正确诊断率80.3%降至50.3%):对GPT-5.5近乎免费,对Gemini近乎全损(-58分)。匹配脚手架对照表明存在真实行为改变、而非裁判循环论证。结论:LLM裁判的临床安全效应应以方向性、相对性的方式报告,锚定于人类评审并与有用性联合评估,而非作为校准的绝对比率。这不构成临床部署就绪性的证明。