论文
SP-DocReader:差异感知自我播放,实现精确的文档 OCR
SP-DocReader: Difference-Aware Self-Play for Precise Document OCR
摘要
在有限的输入和训练预算下,准确的页面转录对于视觉语言模型来说仍然很困难。我们提出了 SP-DocReader,这是一种用于光学字符识别 (OCR) 的自播放框架,其目标是监督微调后的残留错误。读取差异掩蔽通过最长的公共子序列对齐参考和生成的模型标记,然后使用其完整的条件前缀对不匹配的位置进行评分。聚焦保真度损失在无与伦比的真实位置增加了直接的负对数似然监督。仅训练 OCR 模块,而骨干网保持冻结状态。我们推导出组合梯度来区分相对分数优化和直接监督。与SFT-2相比,SP-DR-3在两个主干线上降低了Vary-600K字符错误率。在 Qwen3-VL-4B 上,它将字符错误率降低了约 54%,并将 DocVQA 平均标准化编辑相似度 (ANLS) 提高了 3.7 个点。这些结果表明,将自我对弈训练集中在监督微调后仍然存在的差异上是有价值的。