论文

为什么AI安全需要不确定性、不完全偏好与非阿基米德效用

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

模型评测安全与风险评测

摘要

我们如何确保AI系统与人类价值观保持一致并保持安全?我们可以通过AI协助(AI assistance)与AI关机(AI shutdown)博弈这两个框架来研究这一问题。AI协助问题涉及设计一个帮助人类最大化其效用函数的AI Agent。然而,只有人类自己知道这些函数;AI助手必须学习它们。关机问题则涉及设计这样的AI Agent:当关机按钮被按下时关机;既不试图阻止也不试图促成关机按钮被按下;除此之外称职地完成其任务。在本文中,我们表明,应对这些挑战需要AI Agent能够在不确定性下进行推理,并处理不完全偏好与非阿基米德偏好。

为什么AI安全需要不确定性、不完全偏好与非阿基米德效用 配图
图 1:AI 辅助博弈的各个阶段