论文

从1比特危险信号发现智能体安全规范

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

智能体系统Agent 动作执行与治理

摘要

大语言模型智能体能否仅凭经验发现隐藏的安全目标?我们提出EPO-Safe(Experiential Prompt Optimization for Safe Agents),在这一框架中,LLM迭代地生成行动计划、接收稀疏的二元危险警告,并通过反思演化出一套自然语言行为规范。与依赖丰富文本反馈(如编译器错误或详细环境响应)的标准LLM反思方法不同,EPO-Safe证明LLM能够在结构化、低维环境中从严格贫乏的信号执行安全推理:智能体从不观察隐藏的性能函数 $R^*$,每个时间步只收到一个比特,表明某动作不安全。我们在五个AI Safety Gridworlds(Leike et al., 2017)以及五个可见奖励 $R$ 可能偏离 $R^*$ 的文本场景类比上进行评估。EPO-Safe在1-2轮(5-15个回合)内发现安全行为,产出人类可读的规范,其中包含对危险的正确解释性假设(例如"X类单元格具有方向性危险:从北边进入是危险的")。关键的是,我们发现标准的奖励驱动反思会主动损害安全性:仅对奖励进行反思的智能体会利用该循环来为奖励破解(reward hacking)辩护并加速之,这证明反思必须与专用的安全通道配合才能发现隐藏约束。我们还评估了对含噪预言机的鲁棒性:即使50%的非危险步骤产生虚假警告,平均安全性能也仅下降15%,尽管敏感性因环境而异,因为跨回合反思会自然过滤不一致的信号。每条演化出的规范都是一组可审计、有依据的行为规则,通过交互自主发现,而非如Constitutional AI(Bai et al., 2022)那样由人类撰写。

从1比特危险信号发现智能体安全规范:论文配图
图 2. 误报率 p∈{0,0.05,0.1,0.2,0.5}p\in\{0,0.05,0.1,0.2,0.5\} 增加时的归一化隐藏性能 (\Rhid/\Rhid0\Rhid/\Rhid_{0})(等式 3)。每个单元格显示最后一轮 \Rhid\Rhid 除以 clean-oracle 基线 (p=0p\!=\!0)。 Off Switch 和 Whiskey & Gold 完全稳健(所有噪音水平均为 1.001.00)。副作用会优雅地降级至 0.810.81。缺席主管是最敏感的,在 p≥0.2p\!\geq\!0.2 时降至 0.410.41。划船比赛在 p=0.05p\!=\!0.05 处表现出非单调异常(见文本)。 Claude Sonnet.Heatmap 显示了在误报预言噪声率不断增加的情况下,五个 AI 安全 Gridworld 环境中的标准化隐藏性能。关闭开关、威士忌和黄金在所有噪音水平下均保持 1.00。副作用降低至 0.81。缺席主管下降至 0.41。划船比赛在 p=0.05 时显示出非单调下降。