论文
CEO-Bench:智能体能下长期大棋吗?
CEO-Bench: Can Agents Play the Long Game?
摘要
语言模型智能体正成为软件工程与客服等孤立短程任务的熟练执行者。但真实世界挑战需要智能体身上基本未经检验的组合技能:(1) 在不确定性中驾驭长时程;(2) 在嘈杂环境中获取信息;(3) 适应变化的世界;(4) 把多个活动部件编排向连贯目标。我们介绍CEO-Bench——通过仿真一个代表性真实任务——经营一家初创公司500天——共同评估这些能力。智能体经可编程Python接口管理一家虚构公司的定价、营销、预算等诸多方面——与人类CEO处于同一环境、面对同样挑战。成功要求分析嘈杂互联的业务数据库、把信号转为可靠战略——并以编程协调众多决策。最强智能体编写复杂代码——在不同场景下预测流失机制、计费时点、客户流失与未来现金。即便如此——多数SOTA模型在该环境中挣扎。只有Claude Fable 5、GPT-5.6 Sol与Claude Opus 4.8在100万美元起始资金之上收官——且全部受评模型仍低于基于规则的基线。CEO-Bench朝测量驱动持续自适应进步所需智能迈出第一步。
