论文
Claude AI 编写的 Python 测试的质量并不弱于人类编写的测试
The Quality of Claude AI-authored Python Tests Is Not Weaker Than Human-authored Tests
摘要
我们根据两个已建立的开源项目 Django 和 Pandas 的人工编写的 Python 测试来评估 Claude AI 编写的 Python 测试的质量。每个语料库的数百个测试都在一个相同的协议下进行评分。使用单边非劣性界限,我们发现最近的 Claude 模型(Sonnet/Opus 4.6 及更高版本)编写的测试并不弱于两个人类编写的语料库。在这项研究中:(i)人工智能编写的语料库是来自真实工具的测试,而不是针对固定目标单独生成的综合测试,这是我们所知的所有其他人工智能测试生成研究所使用的设置; (ii) 每个测试都根据三个独立的故障注入协议和七轴定性设计标准单独评分,允许方法相互交叉验证; (iii) 测试是单独评分的,而不是套件级别的,从而准确识别哪些特定测试需要注意。