论文
重新思考 LLM 验证:证据结构、不确定性和选择性细化
Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement
摘要
大语言模型 (LLM) 通常依赖捷径而不是系统推理,这引发了医疗应用中的安全问题。允许模型在不确定时放弃可以提高可靠性,但会带来覆盖精度的权衡。我们提出了一个在多项选择设置中验证医学假设的两阶段框架,该框架通过有针对性的本体论基础来管理这种权衡,仅在模型弃权时应用。我们表明,弃权不是随机的,而是反映了真正的不确定性,弃权的预测与较低的置信度相关。在两个前沿模型(通过 Azure OpenAI API 访问的 GPT-5.5 和 DeepSeek-R1)中,所提出的框架将问题级准确性提高了 9.6 个百分点(82.9% 至 92.5%),将假设级准确性提高了 4.2 个百分点(92.0% 至 96.2%)。我们在 MedReason 和 MedQA 上进行的实验表明,弃权可以重新用作选择性推理细化的控制信号,无需显式知识图构建即可实现知识图级别的性能。