论文
SportD:视觉语言模型如何做物理策略决策
SportD: How do VLMs physically strategize?
摘要
视觉语言模型(VLM)能描述场景,但能在场景中好好行动吗?我们以足球作为带可量化动作价值的客观试验台,研究VLM能否做出合理的策略决策。我们引入SportD:一个由职业男足与女足比赛中1,415个决策场景组成的数据集与评估——VLM观察决策前数秒并选择下一动作。模型仅约30%的时机选出最优动作,甚至低于人类。此外它们对更安全的动作呈明显偏好:偏爱低方差、低价值且朝球门物理进展更小的选择。前沿VLM更善于估计动作能否成功——在83–92%的案例中把成功概率最高的动作排进前列;但VLM系统性地把可能性与价值混为一谈:给更可能成功的动作更高价值(ρ=+0.30至+0.52),而真值中并无这种关系(ρ=-0.08)。保守因此反映价值的错误校准。把单句深思熟虑换成一句导向风险的句子,就把前沿模型拉向真实球员的水平。SportD为严格评估VLM的物理策略决策开辟新方向:对选择的细致分解可揭示风险厌恶等系统性偏误的机制。
