论文

PaperFit:面向科学文档的视觉在环排版优化

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

摘要

编译无误的LaTeX稿件未必达到可发表状态。所得PDF经常出现浮动体错位、公式溢出、表格缩放不一致、孤行寡行以及页面平衡不佳等问题,迫使作者反复进行编译—检查—修改循环。基于规则的工具对渲染后的视觉效果视而不见,只能处理源代码和日志文件。纯文本LLM执行开环文本编辑,无法预测或验证其修改对二维版面的影响。因此,可靠的排版优化需要一个每次编辑后都进行验证的视觉闭环。我们将该问题形式化为视觉排版优化(VTO),即通过迭代式视觉验证与源码级修订,把可编译的LaTeX论文转化为视觉精良、符合页数预算的PDF的任务,并提出五类排版缺陷分类法以指导诊断。我们提出PaperFit,一个视觉在环智能体,迭代地渲染页面、诊断缺陷并施加受约束的修复。为对VTO进行基准测试,我们构建了PaperFit-Bench,包含来自10个会议模板、13种缺陷类型、不同难度的200篇论文。大量实验表明,PaperFit大幅超越所有基线,证实了从可编译源码到可发表PDF的跨越需要视觉在环优化,且VTO构成文档自动化流程中一个关键缺失环节。

PaperFit:面向科学文档的视觉在环排版优化:论文配图
图 1:排版优化方法比较:(a) 基于规则的工具对视觉效果视而不见; (b) 纯文本LLM在开环中运行,无法预测渲染结果; (c) 我们的 PaperFit 系统建立了一个模仿迭代人类工作流程的视觉闭环代理。