论文
JANUS:面向长程智能体安全的潜在风险预见
JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
摘要
智能体安全正从内容审核转向在工具使用型智能体行动之前阻止运营失败。我们提出Janus,一个面向长程智能体安全的预见导向框架:训练守卫从部分轨迹预判延迟风险。Janus经多智能体仿真合成多样的智能体轨迹,并以两个耦合任务学习共享策略:预测任务——预报安全相关的未来;裁决任务——从观测前缀与预期未来两方面决定安全性。两个任务以CoAA-RL联合优化——按预测对下游安全判断的效用给其奖励。所得守卫模型Vanguard在执行前阻断不安全动作。跨四个智能体安全基准,Vanguard较基线守卫把平均保护提升15.9个百分点,同时把良性任务完成率提升5.1个百分点。
