论文
交叉描述汇编指令对齐的视觉语言模型的基准测试和机制分析
Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment
摘要
2D 装配图通常比较抽象且难以理解,因此需要能够监控进度、检测错误并提供分步指导的智能助手。在混合现实设置中,此类系统必须识别摄像机输入中已完成和正在进行的步骤,并将它们与图表指令对齐。视觉语言模型 (VLM) 有望完成这项任务,但由于装配图和视频帧共享的视觉特征很少,因此面临着描述差距。为了系统地评估这一差距,我们构建了 IKEA-Bench,这是一个包含 29 种宜家家具产品的 6 个任务类型的 1,623 个问题的基准,并在三种调整策略下评估 19 个 VLM (2B-38B)。我们的主要发现:(1)汇编指令的理解可以通过文本恢复,但文本同时会降低图表到视频的对齐; (2) 架构族比参数计数更能预测对齐精度; (3)不受策略影响,视频理解仍然是一个硬瓶颈。三级机制分析进一步揭示,图表和视频占据不相交的 ViT 子空间,并且添加文本会将模型从视觉推理转变为文本驱动推理。这些结果将视觉编码确定为提高交叉描述鲁棒性的主要目标。项目页面:https://ryenhails.github.io/IKEA-Bench/