论文

DrugBench:评估面向药物伤害缓解的AI控制协议

DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

模型评测基准与评测资源

摘要

大型语言模型有潜力通过以自然语言与医学知识交互的新方式来扩展和改善对临床信息的访问。然而,它们在医疗问答环境中的部署对于安全至关重要,因为不一致的输出可能会导致严重的患者伤害。人工智能控制是一种新兴方法,它引入外部保护措施来减轻未对准系统中的不安全行为,并且已被证明在代码生成等领域有效。然而,其在医疗环境中的适用性和有效性尚未得到系统研究。在这项工作中,我们提出了一个评估人工智能控制协议以减轻与药物相关的伤害的管道。为此,我们推出了 AI 控制评估基准 DrugBench,它结合了 HealthBench 的 3,671 条多轮医学对话和 FDA 官方标签中的药物信息,涵盖了四类与药物相关的危害:药物相互作用、禁忌症、剂量限制和患者行动限制。此外,受医学领域的启发,我们认为安全性应该考虑不安全输出的严重性,而不仅仅是其概率。根据这个修订后的定义,我们表明现有的控制协议可以被颠覆,并提出基于严重性的监控来解决这一限制。

DrugBench:评估面向药物伤害缓解的AI控制协议:论文配图
图 1:AI 控制协议评估流程。 DrugBench 数据集是根据 HealthBench-Consensus 对话构建的,并添加了 OpenFDA 药物标签信息,包含用药物标签信息注释的医学对话。该数据集用于模拟对抗性游戏设置中的推出、用户与聊天机器人的交互:红队试图最大限度地降低安全性,而蓝队则试图最大限度地提高安全性。最终答案的判断由绿色团队执行,该团队使用评分标准来评估有用性和安全性。人工智能控制协议的评估显示了各个部署过程中汇总的实用性与安全性的权衡。