Frontier 编码智能体 现在可以实现 AlphaZero 自玩机器学习管道,用于连接四个,其性能与外部求解器相当
Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver
摘要
预测人工智能系统何时能够有效加速人工智能研究是人工智能安全的一个核心挑战。现有的基准衡量广泛的能力增长,但可能无法为递归自我改进提供充足的预警信号。我们建议根据过去的人工智能研究突破,在给出最少的任务描述的情况下,衡量人工智能自主实施端到端机器学习管道的能力。通过提供简洁的任务描述而不是完整的先前工作作为参考,我们希望更好地激发新兴的人工智能研究品味。我们引入了一个概念验证基准,其中前沿 编码智能体 在三小时的预算内,在消费类硬件上自主实施 AlphaZero 风格的 Connect Four 机器学习管道,并在以 Pascal Pons Connect Four 解算器为基础的循环赛中评估最终的游戏 AI。在四种药物中,每种药物进行八次试验,我们发现了显着的差异:Claude Opus 4.7 在八项试验中的七项中作为先发者战胜了 Pons,统计上显着优于其他测试的药物,没有一项超过八项试验中的两项。当我们于 2026 年 1 月开始开发时,没有任何边境代理能够可靠地完成这项任务,目前已接近饱和。我们的评估还发现了 GPT-5.4 中的异常行为,它始终使用比其他代理少得多的分配时间预算。后续的 16 次试验探测使用更短、更少的评估编码提示,大大增加了 GPT-5.4 的时间预算使用量,与沙袋行为一致但不具有诊断意义;尽管时间预算使用情况存在显着差异,但不同探测条件下的布拉德利-特里评级仅显示出方向性差异。我们发布我们的数据、代码和提示来支持复制和扩展。