论文
针对通过公开测试代码的代码监控器红队测试
Code Monitor Red Teaming for Public-Test-Passing Code
摘要
可见测试是LLM生成代码的常见门禁,但通过它们不能证明符合规格正确。我们研究一个类部署的监控问题:代码通过公开测试后,较弱的LLM验证器能否识别残留的隐藏bug?我们引入代码监控器红队测试——一个固定公开检查信息边界、同时变化生成器压力、验证器脚手架与弱到强能力的监控器红队协议;实例化为CodeMonitorBench,横跨函数级、数据科学与工作流代码。跨71,000个生成候选:43,677个通过公开测试,其中23,081个未过隐藏测试。弱验证器随脚手架与模型家族改进,但在5%误报率下仍漏掉大部分隐藏bug。作为鲁棒性压力测试,对抗性的公开测试过拟合压力在多数单元降低验证器AUROC、抬高低FPR漏检率。GLM-5.1验证器在相同证据边界下收回部分差距;可推断性审计显示剩余漏检混合了验证器失败与M1证据限制。
