技术实践
Anthropic 工程团队迭代设计抗 AI 的技术招聘评测
概述
这是 Anthropic 工程博客上的一篇研究性博文,属于方法论分享与经验复盘,不是生产系统的落地案例。作者 Tristan Hume 是 Anthropic 性能优化团队负责人。为高效筛选性能工程师,团队自 2024 年初起采用家庭作业式测试:候选人在模拟加速器上优化代码,时限 4 小时、后压缩到 2 小时;已有超过 1000 名候选人完成,数十人由此入职。随着模型能力提升,测试被反复突破:同等时限下 Claude Opus 4 已优于多数人类申请者,Claude Opus 4.5 更追平了最强候选人的水平,只有在无限时间条件下人类仍能胜过模型。作者为此迭代了三个版本的测试,并把明确允许候选人使用 AI 工具、加长问题时间跨度等视为增强评测鲁棒性的方向,同时将原始测试开放为公开挑战:若有人能胜过 Opus 4.5,团队欢迎其应聘。文中披露的均为招聘场景的经验观察,未附模型与人类表现的系统对照数据。