论文

词元扭曲帮助 MLLM 从附近的角度看待问题

Token Warping Helps MLLMs Look from Nearby Viewpoints

上下文与知识上下文工程

摘要

扭曲标记(而不是像素)是否可以帮助多模式 大语言模型 (MLLM) 理解从附近的视点来看场景是如何出现的?虽然 MLLM 在视觉推理方面表现良好,但它们仍然容易受到视点变化的影响,因为像素扭曲对小深度误差非常敏感,并且经常会引入几何扭曲。利用将部分级结构表征作为人类视角转换基础的心理意象理论,我们研究了基于 ViT 的 MLLM 中的图像标记是否可以作为观点变化的有效基础。我们比较前向和后向扭曲,发现后向标记扭曲在目标视图上定义密集网格并为每个网格点检索相应的源视图标记,可以实现更高的稳定性,并在视点移动时更好地保持语义连贯性。我们提出的 ViewBench 基准测试表明,词元级 扭曲使 MLLM 能够从附近的视点可靠地进行推理,始终优于所有基线,包括像素方式扭曲方法、空间微调 MLLM 和生成扭曲方法。