论文

从 BERT 到前沿智能体:语言模型八年的进步、能力成本曲线的崩溃以及任务目标模型的兴起

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

模型评测模型能力评测

摘要

2018 年 10 月至 2026 年 7 月期间,人工智能模型从 BERT 等简单系统发展为解决复杂数学和编写软件的大型代理。自 2024 年底以来,解决实际编码问题的能力每年提高近六倍。在此期间,OpenAI 的预算模型 GPT-5.6 Luna 匹配旗舰功能,成本急剧下降,每百万词元仅需 1 到 6 美元,而旧版本的价格仅为旧版本的一小部分。现在,顶级性能分布在不同的专业模型中,因为 Claude Opus 5 在前端编码方面处于领先地位,Claude Fable 5 在存储库级别编码方面表现出色,而 GPT 5 point 6 Sol 在终端任务中占据主导地位。在小学数学测试中,使用 Qwen 2 点 5 模型,基本方法解决了 100 个问题中的 58 个问题,而高级抽样解决了多达 79 个问题。置信度排名工具在其前 50 个选项中正确识别了 47 个正确答案,事实证明,这对于对所有研究材料完全公开的任务进行排序非常有用。