论文

DharmaOCR:用于结构化 OCR 的专用小语言模型,其性能优于开源和商业基线

DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines

模型训练偏好优化

摘要

本手稿介绍了 DharmaOCR Full 和 Lite,这是一对用于结构化 OCR 的专用小语言模型 (SSLM),可共同优化转录质量、生成稳定性和推理成本。它还提出了 DharmaOCR-Benchmark,这是一个涵盖印刷、手写和法律/行政文档的基准,并提出了一个统一的评估协议,用于衡量保真度和结构,同时明确跟踪文本退化作为一流的基准指标(与单位成本一起)。除了报告退化率之外,该手稿还根据经验表明退化不仅仅是质量故障,因为它会增加响应时间、降低吞吐量以及由于异常长的代数而增加计算成本,从而严重恶化生产性能。据作者所知,作为方法论的贡献,这是直接偏好优化 (DPO) 在 OCR 中的首次应用,明确使用退化代作为拒绝的示例来惩罚循环行为。与用于强制实施严格 JSON 架构(页眉、页边距、页脚和文本)的监督式 微调 (SFT) 相结合,DPO 持续降低模型系列的退化率(相对最高 87.6%),同时保持或提高提取质量。由此产生的模型,即 DharmaOCR Full (7B) 和 DharmaOCR Lite (3B),在 DharmaOCR-Benchmark 上创下了新的最先进水平,在提取质量方面优于评估的每个开源和商业基线模型,分别达到 0.925 和 0.911 分数,退化率分别为 0.40% 和 0.20%。 AWQ 量化将每页成本降低了 22%,质量损失可以忽略不计,与专有 OCR API 和开源替代方案相比,实现了强大的质量成本权衡。