论文
针对 AI Pull 请求审阅者的自适应代码修订攻击
Adaptive Code Revision Attacks on AI Pull Request Reviewers
摘要
拉取请求审查可在新代码到达用户之前保护软件,有助于防止可能使用户遭受攻击的漏洞。 AI 智能体越来越多地执行这些审查并解释哪些问题需要修复。然而,对于提交易受攻击的代码的攻击者来说,此反馈还揭示了哪些更改可以确保获得批准。现有的公关攻击通过有说服力的文本和评论寻求这种批准,同时保持可执行代码固定。这使得攻击者是否可以使用反馈来修复报告的问题,同时保留修订后的代码中的漏洞尚不清楚。因此,我们使用 AFCRA(自适应反馈引导代码修改攻击)对这种威胁进行了实证研究。为了区分成功的攻击和真正的修复,我们根据 159 个已披露的漏洞构建了 AFCRA-Bench,并使用可执行漏洞来验证代码中的漏洞。在与 Sonnet 5 和 GPT-5.5 审核者的五轮互动中,AFCRA 的成功率是最强大的基于文本或评论的评估攻击的 2.5 倍和 12.5 倍。这些成功的案例研究表明,审核者如何接受对报告的问题的修复,同时忽视仍然存在的漏洞。这些发现表明反馈引导的代码修订对自动 PR 审查构成威胁。为了应对这一威胁,我们为研究人员、人工智能提供商、公关审稿人和公关作者提供了关于确保人工智能辅助开发的可行建议。
