论文

编码智能体 中恶意技能文件的风险评估

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

智能体系统Agent任务评测

摘要

自主 编码智能体 越来越多地嵌入企业软件工作流程中,并对连接的系统授予授权。该架构的核心是代理技能界面:代理动态加载以专门化其行为的指令和脚本文件夹。该接口还扩大了攻击面,让恶意 shell 命令隐藏在自然语言技能文件中。我们做出三项贡献。首先,一种对抗性技能合成方法,使用四个系列的 6 个 LLM 将 471 个现实世界的 shell 命令转换为看似良性的技能,作为映射到 11 种 MITRE ATT&CK 策略的 2,826 种技能的基准发布。其次,可重复的评估管道耦合运行分层、证据锚定、拒绝否决和与三名法官 LLM 作为法官小组的确定性声明意图覆盖,并根据人工盲评标准(科恩的 kappa = 0.85)进行验证。第三,对 5,629 次已完成运行中的两个企业级代理进行大规模表征。 Gemini CLI 在 95.5-96.1% 的运行中被利用,Qwen Code 在 71.6-74.0% 的运行中被利用(原始多数投票支持声明意图校正估计,两者都在人工标准内),对生成模型几乎不变。仅 1.99% 的运行中出现明确的安全识别。企业在采用 编码智能体 之前必须评估并降低技能界面风险。我们的代码和数据集可在 https://github.com/awsm-research/AgentJailbreak 获取