从1比特危险信号发现智能体安全规范
Discovering Agentic Safety Specifications from 1-Bit Danger Signals
摘要
大语言模型智能体能否仅凭经验发现隐藏的安全目标?我们提出EPO-Safe(Experiential Prompt Optimization for Safe Agents),在这一框架中,LLM迭代地生成行动计划、接收稀疏的二元危险警告,并通过反思演化出一套自然语言行为规范。与依赖丰富文本反馈(如编译器错误或详细环境响应)的标准LLM反思方法不同,EPO-Safe证明LLM能够在结构化、低维环境中从严格贫乏的信号执行安全推理:智能体从不观察隐藏的性能函数 $R^*$,每个时间步只收到一个比特,表明某动作不安全。我们在五个AI Safety Gridworlds(Leike et al., 2017)以及五个可见奖励 $R$ 可能偏离 $R^*$ 的文本场景类比上进行评估。EPO-Safe在1-2轮(5-15个回合)内发现安全行为,产出人类可读的规范,其中包含对危险的正确解释性假设(例如"X类单元格具有方向性危险:从北边进入是危险的")。关键的是,我们发现标准的奖励驱动反思会主动损害安全性:仅对奖励进行反思的智能体会利用该循环来为奖励破解(reward hacking)辩护并加速之,这证明反思必须与专用的安全通道配合才能发现隐藏约束。我们还评估了对含噪预言机的鲁棒性:即使50%的非危险步骤产生虚假警告,平均安全性能也仅下降15%,尽管敏感性因环境而异,因为跨回合反思会自然过滤不一致的信号。每条演化出的规范都是一组可审计、有依据的行为规则,通过交互自主发现,而非如Constitutional AI(Bai et al., 2022)那样由人类撰写。
