论文

像素文本表示学习的设计基础

On the Design Fundamentals of Pixel Text Representation Learning

模型训练预训练

摘要

丰富文本的视觉输入需要能够直接在像素空间中读取、检索和压缩语言的模型,但现有的像素文本编码器在固定分辨率预训练、视觉捷径学习、弱视觉基础和多语言视觉文本理解方面遇到困难。在这项工作中,我们研究了稳健的视觉文本表示学习所需的基本设计原则。通过系统控制的消融,我们确定了四个关键组成部分:可变图像分辨率和渲染字体大小为高分辨率文档泛化提供空间代理;自然的图像-文本对对于视觉证据对齐和防止纯文本崩溃是不可或缺的;布局感知渲染有助于防止像素级快捷方式;两阶段的多语言课程可以实现有效的跨语言协调。通过将这些原则整合到可扩展的训练方案中,我们训练了 Pixel Linguist II,这是一种通过动态渲染、统一对比基础和超过 2.8 亿个训练示例进行训练的原生分辨率视觉编码器。 Pixel Linguist II 在英语、跨语言和多语言 Visual STS 和 ViDoRe 方面取得了最先进的新结果,同时还实现了更好的 MLLM 下游评估。值得注意的是,Pixel Linguist II 在 80% 视觉词元压缩下仍然保持稳健,显示出光学上下文压缩的巨大前景。我们的代码和资源可从 https://github.com/Pixel-Linguist/Pixel-Linguist-II 获取。