论文

CSPO:缓解结构化表格转LaTeX生成中的奖励歧义

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

模型训练强化学习

摘要

表格包含丰富的结构化信息,但当存储为图像时,其内容仍然“锁定”在像素内。将表格图像转换为 LaTeX 代码可以实现忠实的数字化和重用,但当前的多模态大语言模型 (MLLM) 通常无法保持结构、样式或内容保真度。传统的强化学习 (RL) 后训练通常依赖于单一的聚合奖励,导致奖励模糊性,从而混淆了多个行为方面并阻碍了有效的优化。我们提出了特定于组件的策略优化(CSPO),这是一个 RL 框架,可以解开 LaTeX 表组件(结构、样式和内容)的优化。特别是,CSPO 分配特定于组件的奖励,并仅通过与其组件相关的token反向传播每个信号,从而减轻奖励模糊性并实现有针对性的组件优化。为了全面评估绩效,我们引入了一套分层评估指标。大量实验证明了 CSPO 的有效性,强调了特定于组件的优化对于可靠的结构化生成的重要性。

CSPO:缓解结构化表格转LaTeX生成中的奖励歧义
图 1:表格图像到 LaTeX 生成中奖励模糊性的激励示例。表示正奖励,表示惩罚。 (a) 给定一个表格图像,生成多个 LaTeX 序列,在结构、内容和风格上存在不同的错误(错误用 ✗ 标记)。使用单一的全局奖励会导致奖励模糊性,其中(a1)错误的结构被错误地强化,(a2)正确的内容受到不公平的惩罚,以及(a2)和(a3)尽管组件保真度不同,但获得相同的奖励。 (b) 我们的方法通过将 LaTeX 代码分解为功能组件并为有针对性的优化分配特定于组件的奖励来缓解这一问题,从而减轻奖励的模糊性。