论文
DreamGuard:利用风险感知世界模型实现高效LLM Agent运行时护栏
DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model
摘要
随着大语言模型(LLM)代理越来越多地调用外部工具并与现实世界系统互动,这些行动可能会导致不可逆的后果,影响外部状态、用户数据和后续服务。最近的运行时护栏通过在执行前检查提议的操作来缓解这种风险,但许多仍然反应性:它们主要评估当前操作的安全性,缺乏一个明确的风险模型来预测轨迹中的风险演变。这一限制为长期时间跨度内的风险创造了关键盲点,其中看似个体安全的动作逐渐将代理导向危险状态。为此,我们提出DreamGuard,这是一种围绕风险-aware世界模型的主动护栏。世界模型维护在轨迹上的一致连续潜态,并从未来潜态中预测立即危险和前缀风险证据。然后,它将这些多时间跨度信号融合到干预决策之前。我们在四个基准测试和一个在线护栏评估中的实验结果表明,DreamGuard优于通用、反应性以及主动的护栏基线,实现了在所有护栏基线中最佳的安全-实用性权衡,并保持每调用平均25毫秒的延迟。
