论文

LLM能当CEO吗?多角色智能体仿真基准测试战略资源再分配

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

智能体系统Agent任务评测

摘要

评估大语言模型(LLM)的决策能力是日益优先的研究方向——但既有基准聚焦风格化设定中的孤立认知任务——如推理、知识检索与经济理性。这些评估忽视了真实高管决策的定义性挑战:在信息不对称、组织约束与时间依赖下整合来自专业利益相关者的冲突建议。我们介绍CEO-Bench——多智能体基准——评估LLM在CEO级战略资源再分配上的表现——即在多轮、多约束组织环境中跨业务单元重新配置资本的过程。CEO-Bench中——LLM智能体接收来自四个角色条件化C-suite顾问(CFO、CTO、COO、CMO)的冲突建议——每位持私有信号与不同优先级——必须将其综合为具体配置计划——沿四个维度评估:角色整合、条件性魄力、历史敏感判断与计划有效性。跨五个前沿模型13个场景的实验揭示:全部模型取得高结构有效性——但在战略校准(最难能力层)上急剧分化。我们识别系统性失败模式——包括单一顾问俘获、模糊下的保守默认与历史失忆——并揭示结构性的整合-魄力权衡:更深入参与冲突视角的模型倾向产出更不果断的行动。这些发现划定LLM作为组织决策者的当前能力边界——并为未来AI辅助高管系统的设计提供信息。

LLM能当CEO吗?多角色智能体仿真基准测试战略资源再分配:论文配图
图 1:五种模型的 CEO-Bench 结果摘要。 (一)总分。 (b) 按评估维度分解的分数:角色整合、大胆校准、历史敏感性和计划有效性。 (c) 按难度等级(简单、脆弱、对抗)的平均分数。 (d) 每个模型的结果等级分布:计划无效、分配不当、权衡后可接受以及高质量。