论文
CSPO:缓解结构化表格转LaTeX生成中的奖励歧义
CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation
摘要
表格包含丰富的结构化信息,但当存储为图像时,其内容仍然“锁定”在像素内。将表格图像转换为 LaTeX 代码可以实现忠实的数字化和重用,但当前的多模态大语言模型 (MLLM) 通常无法保持结构、样式或内容保真度。传统的强化学习 (RL) 后训练通常依赖于单一的聚合奖励,导致奖励模糊性,从而混淆了多个行为方面并阻碍了有效的优化。我们提出了特定于组件的策略优化(CSPO),这是一个 RL 框架,可以解开 LaTeX 表组件(结构、样式和内容)的优化。特别是,CSPO 分配特定于组件的奖励,并仅通过与其组件相关的token反向传播每个信号,从而减轻奖励模糊性并实现有针对性的组件优化。为了全面评估绩效,我们引入了一套分层评估指标。大量实验证明了 CSPO 的有效性,强调了特定于组件的优化对于可靠的结构化生成的重要性。
