论文

将语言模型从视觉编码器中解放出来:语义序列化作为小语言模型的感知接口

Free the Language Model From the Vision Encoder: Semantic Serialization as a Perception Interface for Small Language Models

上下文与知识上下文工程

摘要

端到端视觉语言模型(VLM)将视觉能力与其语言模型的规模联系起来:随着语言模型的缩小,感知和推理会一起退化。我们研究了一个具体的场景问答(QA)界面,其中视觉永远不会进入语言模型。冻结的感知堆栈可检测并测距物体;确定性语义序列化器将感知状态(包括错误)编译为决策一致的文本;未经修改的纯文本大语言模型 (LLM) 答案。在可见范围匹配、遮挡审核的校园机器人基准上,在前瞻性冻结标准下,使用在每个折叠内域内微调的检测器的序列化接口优于零样本 VLM,其语言模型具有相同的 7B 尺度(0.7892 与 0.7462),在 3B 处具有更大的裕度(0.7673 与 0.6913)。预先注册的解耦实验表明,增益在释义中得以保留,将其归因于决策对齐计算而不是答案字符串泄漏,而新颖的判断词汇限制了其范围。随着阅读器缩小到 1.5B 并在 0.5B 反转,并且地面真实预言机定位阅读器能力下限,优势就会增强。在匹配的任务监督下,接口收敛:通过低秩自适应(LoRA)进行微调的 VLM 超越了零样本系统,但仅与同等监督的文本阅读器联系在一起(0.8441 与 0.8396,没有统计上解决的差异),并且两条路线仍然受到感知限制。报告的感知参数与 VLM 视觉塔的参数相当,并且总计算量也不小。