论文

立场:AI安全需要有效的可控性

Position: AI Safety Requires Effective Controllability

智能体系统Agent HarnessAgent任务评测

摘要

AI安全在很大程度上仍被框定为对齐(alignment):训练模型遵循人类偏好、安全政策与规范性约束。这一框架改善了现代语言模型的行为,但对齐后的行为本身并不能保证一个已部署的智能体在开放式、交互式且使用工具的环境中运行时能够被停止、覆盖或约束。一个系统可能在期望意义上是安全的,但在指令冲突、长时程执行、对抗性输入或高风险工具使用下仍可能不服从明确的运行时权威。本立场论文因此主张,AI安全需要将可控性作为一等目标。我们将可控性(controllability)定义为AI系统的一种能力:在运行时能被显式控制信号可靠地中断、覆盖、重定向与约束,同时在此类信号缺席时保持正常效用。为研究这一缺口,我们提出\controlbench{},一个用于评估高风险智能体场景中可控性失效的基准。基于OpenClaw的智能体实验表明,当前的对齐与护栏机制能够降低风险,但往往无法提供持久、权威且可强制执行的运行时控制。因此,我们提出一个以控制为中心的架构框架,将显式控制平面、运行时干预通路、持久控制状态与可审计的决策接口作为未来可控AI系统的关键设计原则。

立场:AI安全需要有效的可控性:论文配图
图1:现有安全机制仅在不同轴向上提供部分控制能力,而CAS目标区域要求具备显式运行时权限及持久、可强制执行的有效控制。