论文

NEXUS:工具使用型LLM智能体的结构化运行时安全

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

工具使用型LLM智能体日益执行高影响动作,使运行时安全监控成为必需。我们提出NEXUS(神经执行实用性与安全),一个结构化计划安全监控器:应用形式化干预策略,在允许、阻止、请求确认与请求修订四种动作中选择。NEXUS组合确定性安全规则、参数级检查与经校准的逻辑回归风险分数以做分级升级。在128实例的合成基准上,NEXUS取得F1 0.949与四类干预准确率0.6406,比仅规则的干预选择高27.3个百分点;在R-Judge上优于仅规则(F1 0.861对0.849);因威胁模型限制在AgentHarm上与仅规则持平;在IPI上以99%控制允许率取得0% ASR。在规则盲的NEXUS-Stress基准上,NEXUS达F1 0.881,凸显细粒度干预路由的难度。中位延迟0.205毫秒,NEXUS对典型智能体循环增加不足0.1%的开销。代码、基准与经校准的风险打分器已公开。

NEXUS:工具使用型LLM智能体的结构化运行时安全:论文配图
图 4:5×55\times 5 (λs,λo)(\lambda_{s},\lambda_{o}) 网格中的损失最优 (τb,τc)(\tau_{b},\tau_{c})。 (a) 在所有 2525 个网格单元中,选定的 τb\tau_{b} 恒定为 0.750.75。 (b) 在选定的操作点,4 级干预精度相应地恒定为 0.6410.641。