论文

可扩展的语言智能视觉预训练

Scalable Visual Pretraining for Language Intelligence

模型训练预训练

摘要

大型基础模型的快速进展主要是由大规模文本语料库的预训练推动的。然而,许多形式的知识是通过视觉表示来传达的,其中图形、排版方程和页面布局携带着丰富的信息,而这些信息无法仅通过文本忠实或完整地捕获。然而,当前的预训练方法通过将文档和网页等视觉丰富的资源转换为纯文本来学习语言智能,从而抛弃了这些视觉线索。本文挑战了语言模型必须在纯文本表示上进行训练的默认假设,并表明视觉预训练是基础模型智能的可扩展学习器。为此,我们对无监督视觉预训练范例进行了系统研究,这些范例直接利用视觉文档而无需文本提取。在多个骨干网和基准测试中,同一基础语料库上的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了有效的途径。