论文

看见不等于决策:多模态LLM能胜任CEO吗?

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

模型评测基准与评测资源

摘要

大规模语言模型正越来越多地作为自主决策的代理应用于执行业务决策。然而,现有的基准测试仅限于文本设置,这使得人们不清楚模型是否能够感知到视觉业务证据并有效地将其整合以提高决策质量。我们引入了C-SUITEBENCH,这是一个包括50个场景下配对文本和多模态条件下的控制性多模态基准。我们在首席执行官的角色下将九个前沿模型置于评估其决策能力的位置。多模态输入始终改善证据导向的推理,其中最大的和最可靠的改进出现在风险预测和董事会面谈中。然而,我们揭示了一个多模态集成悖论:添加视觉业务信息会损害所有九个模型的受限资源分配,即使视觉基础本身有所改善。消融实验揭示了这一失败源于信号拥挤,尽管每个视觉通道单独帮助,但它们的组合在解码过程中扰乱约束满足。这些发现表明,在多模态代理中,视觉感知和受限行动是两个分离的瓶颈,并且无选择性的视觉增强会损害高风险决策,这促使未来的执行AI系统采用有针对性的背景策略。

看见不等于决策:多模态LLM能胜任CEO吗?:论文配图
图 1:概述。每个场景都会将文本情况报告与渲染的业务视觉效果配对,并在配对的纯文本和多模态条件下通过特定于任务的自动评分进行评估。中 该基准测试涵盖五项执行任务,涵盖整个决策流程。右 所有九个模型的平均任务得分。