论文
GIF:面向LLM的局部健全几何信息流控制
GIF: Locally Sound Geometric Information Flow Control for LLMs
摘要
大语言模型日益中介智能体系统中敏感数据、不可信输入与特权动作之间的交互——产生安全与隐私风险:从操纵下游工具使用的提示注入到经模型输出的机密信息泄漏。近期基于信息流控制(IFC)的防御展现前景——但缺乏对经模型本身信息流推理的有原则语义基础。由于自回归LLM中任何输入token可能影响任何输出token——既有方法饱受污点爆炸之苦。我们提出几何信息流(GIF)——从输入token到输出追踪信息流的语义框架。GIF用LLM雅可比与局部输出几何上界化受扰输入跨度与模型输出间的Shannon互信息——得到可经自动微分与低秩近似在大型模型上计算的可扩展度量。不同于基于注意力或相关性的归因启发式——GIF满足局部几何健全性——我们提供完全机械化的Lean 4证明:在局部正则性假设下它上界化给定提示诱导的真实信息流。我们在多个提示注入与隐私泄漏基准的完整性与机密性任务上评估GIF。GIF即使无下游去分类器也取得近完美召回——超越基于注意力的基线。结合轻量LLM去分类器——它在token成本最高低81倍的同时匹敌或超越GPT-5.5 xhigh推理等直接LLM裁判基线的F1。用小代理模型检测的GIF流迁移到更大SOTA模型与其他模型家族——即使代理小至200倍——提示可无梯度访问黑盒部署。