论文
安全哨兵:经执行—询问—拒绝路由的上下文感知人工干预
SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing
摘要
LLM智能体经工具调用作用于真实环境,单个误判动作即可造成不可逆伤害。标准保障是护栏模型:把每个提议动作标为安全或不安全。但这种二元视角混淆两个不同决策:动作本身是否有害,以及它是否适合用户的上下文。它还以动作类别而非个体实例为粒度运作,产生侵蚀自主性的例行打断,并训练用户放过最要命的警报。我们把问题重构为{执行、询问、拒绝}上的逐实例三路路由决策,并以Safety Sentry实例化——一个轻量护栏模型,其推理约化为单次解码调用。单个解码时阈值让一个固定检查点无需重训即可重新定位到不同风险容忍度的部署。Safety Sentry在总体准确率与安全相关召回上超过广泛的开放权重与前沿闭源基线,同时同时控制两个方向的错误率。
