论文

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:通过能力注入和遗忘控制进行结构化文档解析

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader: Structured Document Parsing via Capability Injection and Forgetting Control

模型训练强化学习

摘要

我们推出了 Stockmark-Nemotron-3-Nano-Omni-JapanDocReader,这是一个基于 Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 构建的日语文档理解模型。这项工作的中心目标是通过能力注入和遗忘控制进行结构化文档解析:我们将日语结构化文档解析能力注入到面向推理的多模态模型中,同时尽可能保留其文档 VQA 能力。我们研究以解析为中心的SFT,它仅使用结构化文档解析数据;混合SFT,结合了结构化文档解析和VQA数据;以解析为中心的强化学习,通过任务级奖励来优化结构化解析。我们的实验表明,以解析为中心的 SFT 极大地提高了结构化文档解析性能,但会导致可测量的 VQA 遗忘。混合 SFT 减轻了这种遗忘,同时保留了几乎相同的结构化解析性能。在混合 SFT 检查点之上应用基于 DAPO 的以解析为中心的 RL 进一步改进了超出 SFT 上限的结构化文档解析,生成最终发布的模型。训练数据是使用由两个互补的合成流组成的数据引擎构建的:日语文档 VQA 流和程序化结构化文档解析流。我们还讨论了连续结构化文档解析奖励的奖励设计和基于方差的提示过滤,强调了它们对于使强化学习在长推理结构化文档解析任务中有效的重要性。