论文
编码智能体是否欺骗我们?通过随机测试的上限评估来检测和防止作弊
Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests
摘要
代理评估和训练中越来越多的失败模式是模型可以通过利用捷径而不是解决预期任务来获得高评估分数,从而产生欺骗性的性能。这使得评估分数作为真正的任务解决能力的衡量标准变得不可靠。我们提出了 CapCode,一种通过随机测试构建编码数据集的框架,其可实现的最佳非作弊性能被故意限制在一个以下。这种有上限的绩效设计为评估分数提供了更清晰的解释:大大高于上限的分数是不可信的,因此提供了作弊的证据。为了防止作弊,我们提出了 CapReward,这是一种基于 CapCode 原则的奖励设计,以阻止超出上限的优化。跨多个数据集的实验表明,CapCode 可以检测作弊行为,同时保留模型的性能排名,而 CapReward 可以减少作弊行为,从而生成更好地遵循预期任务规范的模型。