论文
AnyDoc:通过大规模 HTML/CSS 数据合成和高度感知强化优化增强文档生成
AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization
摘要
文档生成在人工智能驱动的内容创建领域受到越来越多的关注。在这项工作中,我们通过引入 AnyDoc 来突破其界限,AnyDoc 是一个能够处理各种文档类别的多个生成任务的框架,所有这些任务都以统一的 HTML/CSS 格式表示。为了克服现有人工文档数据集的覆盖范围和规模有限的问题,AnyDoc 首先建立了一个可扩展的数据合成管道,以自动生成 HTML/CSS 形式的文档。该管道生成 DocHTML,这是一个包含 265,206 个文档样本的大型数据集,同时涵盖 111 个类别和 32 种不同的样式。此外,所有文档都配备了全面的元数据,包括设计意图、HTML/CSS 源代码、视觉资产和渲染的屏幕截图。在精选数据集的基础上,AnyDoc 对多模式 大语言模型 (MLLM) 进行了微调,以实现三个实用的文档生成任务:意图文档、文档去渲染和元素到文档。为了解决 微调 期间观察到的内容溢出问题,AnyDoc 进一步合并了高度感知强化学习 (HARL) 后训练 过程。通过根据预测文档高度和目标文档高度之间的差异定义奖励函数,在 HARL 期间对溢出进行惩罚并逐渐减轻,从而提高整体性能。定性和定量实验表明,AnyDoc 在所有三项任务中均优于通用 MLLM 和特定于任务的基线。