论文

SportD:视觉语言模型如何做物理策略决策

SportD: How do VLMs physically strategize?

模型评测基准与评测资源

摘要

视觉语言模型(VLM)能描述场景,但能在场景中好好行动吗?我们以足球作为带可量化动作价值的客观试验台,研究VLM能否做出合理的策略决策。我们引入SportD:一个由职业男足与女足比赛中1,415个决策场景组成的数据集与评估——VLM观察决策前数秒并选择下一动作。模型仅约30%的时机选出最优动作,甚至低于人类。此外它们对更安全的动作呈明显偏好:偏爱低方差、低价值且朝球门物理进展更小的选择。前沿VLM更善于估计动作能否成功——在83–92%的案例中把成功概率最高的动作排进前列;但VLM系统性地把可能性与价值混为一谈:给更可能成功的动作更高价值(ρ=+0.30至+0.52),而真值中并无这种关系(ρ=-0.08)。保守因此反映价值的错误校准。把单句深思熟虑换成一句导向风险的句子,就把前沿模型拉向真实球员的水平。SportD为严格评估VLM的物理策略决策开辟新方向:对选择的细致分解可揭示风险厌恶等系统性偏误的机制。

SportD:视觉语言模型如何做物理策略决策:论文配图
图 1:SportD 任务。从助跑剪辑、决策帧和自上而下的地图(字母圆圈代表球员,金星代表持球球员,箭头代表进攻方向),VLM 选择一个动作:传球给字母队友或射门。右下:三个 VLM 和真实玩家的选择,如果最优则为绿色,否则为红色。这里,一个 VLM,GPT 5.6 Sol,找到了最佳通过;其他人以及(投篮的)球员则不会。