论文

DreamGuard:利用风险感知世界模型实现高效LLM Agent运行时护栏

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

智能体系统Agent 动作执行与治理Agent Harness

摘要

随着大语言模型(LLM)代理越来越多地调用外部工具并与现实世界系统互动,这些行动可能会导致不可逆的后果,影响外部状态、用户数据和后续服务。最近的运行时护栏通过在执行前检查提议的操作来缓解这种风险,但许多仍然反应性:它们主要评估当前操作的安全性,缺乏一个明确的风险模型来预测轨迹中的风险演变。这一限制为长期时间跨度内的风险创造了关键盲点,其中看似个体安全的动作逐渐将代理导向危险状态。为此,我们提出DreamGuard,这是一种围绕风险-aware世界模型的主动护栏。世界模型维护在轨迹上的一致连续潜态,并从未来潜态中预测立即危险和前缀风险证据。然后,它将这些多时间跨度信号融合到干预决策之前。我们在四个基准测试和一个在线护栏评估中的实验结果表明,DreamGuard优于通用、反应性以及主动的护栏基线,实现了在所有护栏基线中最佳的安全-实用性权衡,并保持每调用平均25毫秒的延迟。

DreamGuard:利用风险感知世界模型实现高效LLM Agent运行时护栏:论文配图
图 1:DreamGuard 概述。 (1)风险感知世界模型:将轨迹前缀和建议的行动编码为循环潜在状态,预测后继潜在状态,并产生直接危险和前缀风险评分。 (2)多层面风险估计:聚合时间风险证据并应用校准的干预规则以在行动执行之前输出运行时决策。