论文
AgentLens:经机制子空间的多轮编码智能体可解释安全转向
AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent
摘要
基于大语言模型(LLM)的编码智能体展示卓越自主能力——但也在与外部环境的多轮交互中引入显著安全与滥用风险。既有安全机制主要依赖外部护栏——在执行期间做细粒度行为控制的能力有限。同时——近期面向LLM安全的机制可解释性方法大多局限于单轮或越狱式QA设定——限制其捕捉多轮智能体执行演化风险动态的能力。本文从内部视角研究多轮编码智能体的安全性。我们提出AgentLens(机制子空间干预与转向)——白盒防御框架:为编码智能体执行运行时安全检测与表示级缓解。不同于常规智能体护栏——AgentLens从步级隐藏表示检测有害执行状态——并经干预单层内10维子空间缓解不安全行为。为支撑该研究——我们引入机制智能体安全(MAS)基准:含使用LLaMA-3.1-8B、Qwen-2.5-7B与Gemma-2-9B的194个任务的全面标注多轮执行轨迹。大量实验表明AgentLens取得强安全检测性能——为前瞻风险预期提供初步证据——并大幅减少编码智能体的有害动作——为把机制可解释性应用于动态LLM智能体安全奠定基础。代码见 https://github.com/EddyLuo1232/AgentLens。
