论文
Careful Judge:风险受控的人机协同决策
Careful Judge: Safe and Efficient Human-AI Collaborative Decision Making
摘要
在人类与人工智能协作决策中,人类审查可以防止不安全的人工智能决策,但每个人类判断的成本都是高昂的。将人工智能弃权后的人类干预视为一次性后备措施,会错失改善未来人工智能决策以实现更大自动化的机会,而人工智能从选择性查询的人类反馈中进行自适应学习,打破了为旧模型校准的安全护栏。我们通过 CARE(校准的自适应纠正和升级)来应对这一挑战,这是一种端到端管道,将人工智能模型和人工审核员结合起来,以保证安全、人性化的决策,同时不断从人类反馈中学习,以更少的人工查询实现更高的自动化。 CARE 是有原则的、通用的、模块化的,可以与任何黑盒人工智能模型配合使用。我们新颖的自适应校准模块保证了任何校正模块在每个时间步骤的风险控制。我们进一步展示了当人工智能模型经过良好训练并且人类与人工智能的错位具有清晰的结构时,CARE 如何提高查询效率。对四个安全关键的现实世界数据集进行实验,涵盖驾驶、 语言和机器人技术表明,CARE 实现了与人类一致的决策,同时相对于基线减少了 25-81% 的人类查询。
