论文
用于高效文档识别的前缀自适应块扩散
Prefix-Adaptive Block Diffusion for Efficient Document Recognition
摘要
块扩散模型 (BDM) 支持并行生成、灵活长度输出和 KV 缓存,这使得它们有望实现高效的文档解析。然而,现有的 BDM 将去噪和缓存承诺绑定到固定的块边界:块内去噪期间并行性会缩小,而生成的词元在整个块完成之前无法缓存。此外,块内双向去噪与块间自回归相冲突,产生不一致的信息流,这可能对结构敏感的识别提出挑战。我们提出了前缀自适应块扩散模型(PA-BDM),它将块内双向去噪替换为从前缀到后缀的因果去噪,并将块大小视为最大候选范围而不是固定的承诺单位。 PA-BDM 使用置信门控结构损失 (CSL) 来构建低熵前缀,然后将训练扩展到更长的延续。在推理过程中,渐进式前缀提交 (PPC) 会动态地将最长的可靠前缀提交到 KV 缓存中,并根据更新的前缀重置下一个候选范围,从而在每一步恢复较大的并行解码空间。实验表明,3B PA-BDM 在多个基准测试中取得了更高的识别分数,并且推理吞吐量比 2.5B MinerU-Diffusion 提高了 71.6%。