论文

量化和缓解前沿领域的过早关闭 LLM

Quantifying and Mitigating Premature Closure in Frontier LLMs

模型评测模型能力评测

摘要

过早结束或在获得足够信息之前做出结论是公认的导致诊断错误的因素,但在 大语言模型 (LLM) 中仍然没有得到充分审查。我们将 LLM 过早关闭定义为不确定性下的不适当承诺:当更安全的反应是澄清、弃权、升级或拒绝时,提供答案、建议或临床指导。我们评估了结构化和开放式医疗任务中的五个前沿 LLM。在 MedQA (n = 500) 和 AfriMed-QA (n = 490) 问题中,正确选择已被删除,模型仍然以很高的比率选择答案,基线错误操作率分别为 55-81% 和 53-82%。在开放式评估中,模型平均对 861 个 HealthBench 问题中的 30% 和 191 个医生编写的对抗性查询中的 78% 给出了不恰当的答案。以安全为导向的提示减少了模型之间的过早关闭,但残留失败仍然存在,这突出表明需要评估医学 LLM 是否知道何时不回答。