论文

CEO-Bench:智能体能下长期大棋吗?

CEO-Bench: Can Agents Play the Long Game?

智能体系统Agent任务评测长程任务评测

摘要

语言模型智能体正成为软件工程与客服等孤立短程任务的熟练执行者。但真实世界挑战需要智能体身上基本未经检验的组合技能:(1) 在不确定性中驾驭长时程;(2) 在嘈杂环境中获取信息;(3) 适应变化的世界;(4) 把多个活动部件编排向连贯目标。我们介绍CEO-Bench——通过仿真一个代表性真实任务——经营一家初创公司500天——共同评估这些能力。智能体经可编程Python接口管理一家虚构公司的定价、营销、预算等诸多方面——与人类CEO处于同一环境、面对同样挑战。成功要求分析嘈杂互联的业务数据库、把信号转为可靠战略——并以编程协调众多决策。最强智能体编写复杂代码——在不同场景下预测流失机制、计费时点、客户流失与未来现金。即便如此——多数SOTA模型在该环境中挣扎。只有Claude Fable 5、GPT-5.6 Sol与Claude Opus 4.8在100万美元起始资金之上收官——且全部受评模型仍低于基于规则的基线。CEO-Bench朝测量驱动持续自适应进步所需智能迈出第一步。

CEO-Bench:智能体能下长期大棋吗?:论文配图
图 1:CEO-Bench 通过在现实且充满挑战的环境中模拟初创公司 500 天以上来评估一般的长期代理能力。该代理通过可编程接口进行操作,可以访问业务数据库、公司管理工具和社交媒体。结果是由部分可观察的、嘈杂的、不断变化的市场驱动的,具有延迟和耦合的后果。