论文
过期不等于不安全:基础设施状态竞争下工具使用型LLM智能体的守卫精度
Stale Does Not Mean Unsafe: Guard Precision for Tool-Using LLM Agents under Infrastructure State Races
摘要
使用工具的语言模型智能体日益修改调度器、数据管道、对象存储和访问控制系统。在智能体读取与提交之间,外部状态可能发生变化,但并非每次变化都使提交不安全。我们区分使声明的安全谓词失效的竞争与保持谓词的竞争及无关竞争,并探究运行时守卫区分它们的精确程度。我们的确定性模拟器把可见状态与权威状态分离,在四个领域的16个基础设施任务中注入五种非原子故障机制;冻结的智能体提案在每个控制器下被反事实重放,无需LLM裁判。我们在三个本地托管的量化模型家族(Qwen3-4B、Phi-4-mini、Gemma4-8B;单GPU上3,456条轨迹)上评测三种提交时守卫粒度(全局纪元、读取集版本、语义提交谓词)、多级验证和模型侧门控。三种守卫都消除了不安全提交,但可用性差异悬殊:基于新鲜度的守卫不必要地阻断92-95%的良性竞争,损失最多43%的安全任务完成,而完整谓词守卫一个都不阻断。这种精度依赖契约:删除一条声明条款恰好把其故障族转为不安全提交(最多7.9%)。模型侧信号不能替代:口头置信度校准失准(ECE约0.37),动作一致性与随机门控相当,警示提示基本不改变直接不安全率,而且在新鲜度守卫阻断后,智能体会基于刷新但仍不完整的读取再次不安全地提交。在遥测退化时,隐藏的并发修改在观测上保持干净,限制了所有选择性策略。因此,精确的运行时强制需要语义契约,而非新鲜度启发式或模型自我评估。