论文

针对通过公开测试代码的代码监控器红队测试

Code Monitor Red Teaming for Public-Test-Passing Code

模型评测基准与评测资源

摘要

可见测试是LLM生成代码的常见门禁,但通过它们不能证明符合规格正确。我们研究一个类部署的监控问题:代码通过公开测试后,较弱的LLM验证器能否识别残留的隐藏bug?我们引入代码监控器红队测试——一个固定公开检查信息边界、同时变化生成器压力、验证器脚手架与弱到强能力的监控器红队协议;实例化为CodeMonitorBench,横跨函数级、数据科学与工作流代码。跨71,000个生成候选:43,677个通过公开测试,其中23,081个未过隐藏测试。弱验证器随脚手架与模型家族改进,但在5%误报率下仍漏掉大部分隐藏bug。作为鲁棒性压力测试,对抗性的公开测试过拟合压力在多数单元降低验证器AUROC、抬高低FPR漏检率。GLM-5.1验证器在相同证据边界下收回部分差距;可推断性审计显示剩余漏检混合了验证器失败与M1证据限制。

针对通过公开测试代码的代码监控器红队测试:论文配图
图 1:代码监视器红队概述。在 M1 验证者审查之前公开测试筛选候选人;隐藏测试仅提供标签,而实验会改变生成器压力、验证器能力和代码表面。