论文

从代码审查到代码批评:人工智能生成的大规模差异的意图、偏差和焦点

From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

摘要

AI编码智能体生成的代码量已超过传统同行审查能力,而现有AI审查工具过度关注风格和最佳实践等低价值建议,对人工最关注的正确性、安全性与性能关注不足。本文提出ARCTIC,一个AI代码批判系统,围绕三项能力组织审查:根据对话日志与元数据推断修改意图;通过反向翻译测量开发者意图与智能体输出的偏差;给代码差异中最需人工检查的区域排序。功能依据来自18000次代码审查的六主题分类。离线评估中,意图预测F1为0.86,漂移检测与人工标注的加权一致性QWK为0.907;代码聚焦的质量估计效果为AI审查基线的2.4倍,词元用量为其五分之一。在试验部署中,漂移分数使代码与意图不一致额外减少5.76分(p=0.026),意图预测获得90.2%认可;上线以来,尚未有缺陷被归因于经过自审的代码变更。