AeSlides:通过可验证的奖励激励基于 LLM 的幻灯片生成中的美观布局
AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards
摘要
大语言模型 (LLM) 在代理任务中表现出强大的潜力,特别是在幻灯片生成方面。然而,幻灯片生成提出了一个根本性的挑战:生成过程以文本为中心,而其质量则由视觉美学决定。这种模态差距导致当前模型经常生成布局不美观的幻灯片。现有的解决方案通常依赖于强烈的视觉反射,这会产生较高的推理成本,但收益有限;或者在具有大规模数据集的 微调 上,它仍然提供弱和间接的美学监督。相比之下,明确使用美学原则作为监督仍有待探索。在这项工作中,我们提出了 AeSlides,这是一个强化学习框架,可为幻灯片生成中的美学布局监督提供可验证的奖励。我们引入了一套精心设计的可验证指标来量化幻灯片布局质量,以准确、高效和低成本的方式捕获关键布局问题。利用这些可验证的指标,我们开发了一种基于 GRPO 的强化学习方法,该方法可以直接优化幻灯片生成模型,以获得美观一致的布局。在 GLM-4.7-Flash 上仅使用 5K 训练提示,AeSlides 将纵横比合规性从 36% 提高到 85%,同时将空白减少 44%,元素碰撞减少 43%,视觉不平衡减少 28%。人类评估进一步显示整体质量有了显着提高,分数从 3.31 提高到 3.56 (+7.6%),优于基于模型的奖励优化和基于反射的代理方法,甚至超越了 Claude-Sonnet-4.5。这些结果表明,这种可验证的美学范式提供了一种有效且可扩展的方法,使幻灯片生成与人类审美偏好保持一致。我们的存储库位于 https://github.com/ympan0508/aeslides。