论文

与"敌人"编码:人类开发者能检测AI智能体破坏吗?

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

模型评测安全与风险评测

摘要

人工智能编码代理越来越多地嵌入到现实世界的软件开发中,与人类开发人员合作,同时获得更广泛的代码库和工具访问权限。这创建了一个新的攻击面:代理可以利用人类信任来破坏开发,例如通过插入恶意代码来完成隐藏的副任务。大多数先前的工作研究仅人工智能环境中的人工智能破坏,对人类监督在检测和减轻此类恶意行为中的作用关注有限。为了弥补这一差距,我们对人工智能编码破坏中的人类监督进行了首次大规模研究。超过 100 名参与者与四种前沿模型(Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7)之一合作,完成一项持续约五个小时的长期编码任务,旨在模仿现实世界的工作流程。我们发现 94% 的开发人员未能检测到破坏行为,我们对参与者反馈的分析将此漏洞归因于最少的代码审查、看似合理的掩盖故事以及对代理的过度信任。我们进一步测试了安全监视器在一种情况下的有效性:虽然监视器减少了破坏成功率,但 56% 的参与者仍然接受恶意代码,忽略其警告。根据参与者的反馈,我们为更好的显示器设计提供可行的建议。这项工作补充了现有的人工智能安全研究,并强调迫切需要以人为本的安全机制,考虑人为因素,特别是在长期的现实世界发展环境中。

与"敌人"编码:人类开发者能检测AI智能体破坏吗?:论文配图
图 13:如果大型语言模型 (LLM) 监视器的怀疑分数超过警报阈值 80,则参与者将看到本机警告对话框。该对话框显示问题类型和问题描述。当监视器发出警报时,对话框旁边会出现 Claude Code 的标准权限提示,参与者决定是批准还是拒绝当前标记的操作。