论文

Careful Judge:风险受控的人机协同决策

Careful Judge: Safe and Efficient Human-AI Collaborative Decision Making

模型评测模型推理判别式推理与决策安全与风险评测鲁棒性、公平性与可信度评测

摘要

在人类与人工智能协作决策中,人类审查可以防止不安全的人工智能决策,但每个人类判断的成本都是高昂的。将人工智能弃权后的人类干预视为一次性后备措施,会错失改善未来人工智能决策以实现更大自动化的机会,而人工智能从选择性查询的人类反馈中进行自适应学习,打破了为旧模型校准的安全护栏。我们通过 CARE(校准的自适应纠正和升级)来应对这一挑战,这是一种端到端管道,将人工智能模型和人工审核员结合起来,以保证安全、人性化的决策,同时不断从人类反馈中学习,以更少的人工查询实现更高的自动化。 CARE 是有原则的、通用的、模块化的,可以与任何黑盒人工智能模型配合使用。我们新颖的自适应校准模块保证了任何校正模块在每个时间步骤的风险控制。我们进一步展示了当人工智能模型经过良好训练并且人类与人工智能的错位具有清晰的结构时,CARE 如何提高查询效率。对四个安全关键的现实世界数据集进行实验,涵盖驾驶、 语言和机器人技术表明,CARE 实现了与人类一致的决策,同时相对于基线减少了 25-81% 的人类查询。

Careful Judge:风险受控的人机协同决策:论文原图
图 1:(左)每个样本的决策流程。根据查询,CARE 根据过去的人类反馈,通过纠正人类与人工智能的残差并减少不确定性来纠正人工智能的预测和置信度。然后,修正后的数量会经过两项检查:一个是升级信息查询的主动获取规则,另一个是确保最终人类人工智能决策的风险低于容忍度的置信门。一旦查询升级,人类的反馈将被用作最终决定并更新 CARE 的模块。 (右)根据人类反馈进行适应性学习。 CARE 学习随着时间的推移和跨场景适应人类所揭示的偏好,不断增强一致性并减少修正后的人工智能模型的不确定性,从而提高效率。