论文

安全性和准确性遵循临床中不同的标度法则 大语言模型

Safety and accuracy follow different scaling laws in clinical large language models

模型评测安全与风险评测

摘要

临床 LLM 通常通过增加模型大小、上下文长度、检索复杂性或推理时间计算来扩展,隐含的期望是更高的准确性意味着更安全的行为。这种假设在医学上是不完整的,在医学上,一些自信的、高风险的或证据矛盾的错误可能比平均基准表现更重要。我们引入了 SaFE-Scale,这是一个用于衡量临床 LLM 安全性在模型规模、证据质量、检索策略、上下文暴露和推理时间计算方面如何变化的框架。为了实例化该框架,我们引入了 RadSaFE-200,这是一个以放射安全为中心的评估基准,包含 200 个多项选择问题,其中包含临床医生定义的干净证据、冲突证据以及针对高风险错误、不安全答案和证据矛盾的选项级标签。我们在六种部署条件下评估了 34 个本地部署的 LLM:闭卷提示(零样本)、干净证据、冲突证据、标准 RAG、代理 RAG 和最大上下文提示。干净的证据产生了最强的改进,平均准确率从 73.5% 提高到 94.1%,同时将高风险错误从 12.0% 降低到 2.6%,矛盾从 12.7% 降低到 2.3%,危险的过度自信从 8.0% 降低到 1.6%。标准 RAG 和代理 RAG 没有重现这种安全性:代理 RAG 比标准 RAG 提高了准确性并减少了矛盾,但高风险错误和危险的过度自信仍然较高。最大上下文提示增加了延迟,但没有缩小安全差距,而额外的推理时间计算仅产生有限的收益。最坏情况分析表明,临床后果性错误集中在一小部分问题中。因此,临床 LLM 安全性不是扩展的被动结果,而是由证据质量、检索设计、上下文构建和集体失败行为塑造的部署属性。