论文
RT-Safe:实时具身环境中的Agent安全评测
RT-Safe: Benchmarking Agent Safety in Real-Time Embodied Environment
摘要
AI Agent的快速进展引起了更多安全关注,既有评测主要集中于数字环境。随着Agent进入物理世界,具身安全愈发重要:失败可能导致人身伤害和昂贵硬件损坏。除选择安全动作外,具身Agent还必须满足实时约束,因为物理世界不会在Agent推理时暂停。推理期间行人移动、车辆接近,观测时安全的动作可能在执行前已变得危险。因此,实时具身安全同时取决于决策质量和决策延迟。我们提出RT-SAFE,一个用于实时约束下具身Agent安全评测的仿真城市基准。它结合导航任务、移动参与者、环境危险与交通规则,并让世界在推理和执行期间持续变化。在八个VLM上,Agent完成任务的比例较高,却几乎从未安全完成:最难设置下只有0.7%的回合没有发生安全事件。在匹配的静态与实时评测中,任务完成率分别为91.3%和94.1%,而实时执行使碰撞增加12.3倍。这说明普通任务成功率可能掩盖严重安全失败,决策延迟本身也可能造成物理风险。最后,我们展示RT-SAFE可支持离线强化学习训练,大幅减少碰撞,同时保持较高任务完成率。
