论文
ILION:面向Agentic AI系统的确定性执行前安全闸门
ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems
摘要
能执行现实动作——文件系统操作、API调用、数据库修改、金融交易——的自主AI智能体激增,带来现有内容审核基础设施未覆盖的一类安全风险。当前文本安全系统评估语言内容是否有暴力、仇恨言论、色情等伤害类别;其在架构上不适合评估拟议动作是否落在智能体被授权的操作范围内。我们提出ILION(Intelligent Logic Identity Operations Network),一个面向Agentic AI系统的确定性执行闸门。ILION采用五组件级联架构——瞬时身份印记(TII)、语义向量参考系(SVRF)、身份漂移控制(IDC)、身份共振评分(IRS)与共识否决层(CVL)——无需统计训练或API依赖即可把拟议动作分类为BLOCK或ALLOW。系统零标注数据需求,亚毫秒级延迟,产出完全可解释的判定。我们在自建基准ILION-Bench v2上评估ILION,该基准含八类攻击共380个测试场景,39%为高难度对抗样本,并设留出开发划分。ILION达到F1 = 0.8515、精确率91.0%、误报率7.9%,平均延迟143微秒。与三个基线的对比评估——Lakera Guard(F1 = 0.8087)、OpenAI审核API(F1 = 0.1188)与Llama Guard 3(F1 = 0.0105)——表明现有文本安全基础设施因任务根本错配而在智能体执行安全任务上系统性失效。ILION较最佳商用基线高出4.3个F1点,同时快2000倍、误报率低四倍。