论文

DocPO:通过定制的步骤感知奖励推进文档策略优化

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

模型训练强化学习

摘要

用于文档解析的强化学习(RL)通常依赖于植根于编辑距离(例如,树编辑距离)的基于参考的奖励,但在高精度情况下仍然很难优化,因为这种奖励的辨别力很弱:接近正确的输出收到非常相似的分数,为困难情况提供有限的学习信号。我们提出了逐步感知退火(SAA),这是一种即插即用的奖励锐化机制,可在训练期间逐步增加奖励曲率,放大高分样本之间的细微质量差异,同时保持早期学习的稳定性。在 SAA 的基础上,我们引入了 DocPO,这是一个文档策略优化框架,具有基于元素的、基于参考的奖励,以编辑距离信号为锚定:文本的标准化字符串编辑距离 (NED)、表格的树编辑距离相似性 (TEDS) 以及公式的混合 Rubric+编辑奖励。 OmniDocBench 和 DocElemHard 上的实验表明,与非退火奖励相比,SAA 持续改进了跨文档元素的 GRPO 式 RL,并且不需要额外的人工监督来构建奖励。