论文
语言的成本:质心擦除暴露并利用多模态语言模型中的模态竞争
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
摘要
多模态语言模型在视觉感知任务上系统地表现不佳,但这种失败背后的结构仍然知之甚少。我们提出质心替换,将标记映射到最近的 K 均值质心并删除簇内残余结构,作为模态依赖性的受控探针。在跨越四个架构系列的七个模型中,在六个 BLINK 任务上,图像后文本替换的准确性比视觉替换高 4 倍; VPBench 和 MedBLINK 保留了这种聚合顺序。由于文本替换也会破坏任务和答案界面,因此差距衡量相对依赖性。文本质心对比解码 (TCCD) 无需重新训练即可利用这种不对称性,在 oracle best-per-task $α_\text{interp}$ 的单个任务上恢复高达 +16.9% 的准确度;每个模型至少在一项任务上获得收益,尽管收益因任务和模型而异。总之,质心替换提供了对标记数据的模态依赖性的免再训练审核,而 TCCD 提供了可重复使用的推理时间干预。代码和工件可在以下位置获取:https://github.com/yahskapar/centroid-erasure