论文

感官全闭:全模态LLM中的表征-行动差距

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

模型评测模型行为与机制分析

摘要

当全模态大语言模型接受一个文本前提与其实际所见所闻相矛盾的问题时,失败究竟出在感知还是行动?近期的全模态模型被定位为联合处理视频、音频与文本的感知接地智能体,但一种最基本的接地形式仍未被检验:发现文本断言与模型自身感觉输入之间的冲突。我们提出IMAVB,一个精选自长电影的500片段基准,采用跨目标模态(视觉、音频)与前提条件(标准、误导)的2x2设计,使我们能把冲突检测与普通多模态理解分开测量。跨八个开源全模态LLM与Gemini 3.1 Pro,我们记录到一种表征-行动差距:隐藏状态能可靠编码前提-感知失配,即便同一模型在输出中几乎从不拒绝错误断言。行为上,模型陷入两种失败模式:拒绝不足——像假前提为真一样回答误导性问题;拒绝过度——拒绝得更频繁,但连标准问题也拒绝,牺牲了普通理解准确率。该差距具有模态不对称性(音频接地弱于视觉),并在七种提示变体下依然顽固存在。作为初步的诊断性干预,探针引导的logit调整(PGLA)将编码的失配信号重新注入解码过程,并持续改善拒绝行为。总体而言,这些结果表明全模态接地的瓶颈在于转化而非感知。

感官全闭:全模态LLM中的表征-行动差距:论文配图
图1:IMAVB上表征-动作差距的总览:全模态理解强而动作执行滞后的错位现象。