论文

P-MTP:通过渐进深度缩放的多标记预测进行高效文档解析

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

模型推理投机采样

摘要

视觉语言模型 (VLM) 通过实现从图像到结构化文本的端到端映射,彻底改变了文档解析,带来了显着的延迟瓶颈,特别是对于词元密集的文档。虽然多词元预测 (MTP) 已成为加速推理的一种有前途的方法,但在扩展到更深的前瞻深度时,其潜力受到优化不稳定的限制。在本文中,我们提出了 \textbf{P-MTP},这是一个框架,利用 \textbf{Progressive Multi-Token Prediction} 和轻量级 MTP 模块来扩展高吞吐量文档解析的前瞻深度。具体来说,我们引入了渐进式课程损失,它使用累积路径可靠性和回顾性目标一致性来自适应地重新加权不同的前瞻深度。通过有效抑制长程预测中的梯度噪声,P-MTP 促进了自动从易到难的优化过渡,使模型能够掌握越来越远的前瞻深度。此外,我们提出置信门动态绘图,通过在推理过程中自适应校准推测长度来最大化有效前瞻深度和接受率,从而最大限度地减少计算浪费并进一步突破推理加速的界限。跨多个基准和架构的实验结果表明,P-MTP 实现了高达 5 倍的加速,而准确性损失可以忽略不计,首次成功验证了文档解析领域中的广泛前瞻 MTP。