论文
DrugBench:评估面向药物伤害缓解的AI控制协议
DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation
摘要
大型语言模型有潜力通过以自然语言与医学知识交互的新方式来扩展和改善对临床信息的访问。然而,它们在医疗问答环境中的部署对于安全至关重要,因为不一致的输出可能会导致严重的患者伤害。人工智能控制是一种新兴方法,它引入外部保护措施来减轻未对准系统中的不安全行为,并且已被证明在代码生成等领域有效。然而,其在医疗环境中的适用性和有效性尚未得到系统研究。在这项工作中,我们提出了一个评估人工智能控制协议以减轻与药物相关的伤害的管道。为此,我们推出了 AI 控制评估基准 DrugBench,它结合了 HealthBench 的 3,671 条多轮医学对话和 FDA 官方标签中的药物信息,涵盖了四类与药物相关的危害:药物相互作用、禁忌症、剂量限制和患者行动限制。此外,受医学领域的启发,我们认为安全性应该考虑不安全输出的严重性,而不仅仅是其概率。根据这个修订后的定义,我们表明现有的控制协议可以被颠覆,并提出基于严重性的监控来解决这一限制。
