论文

学会演示:面向智能体幻灯片生成的逆向规范奖励

Learning to Present: Inverse Specification Rewards for Agentic Slide Generation

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

自动化演示文稿生成仍是一项具有挑战性的任务,需要连贯的内容创作、视觉设计与面向受众的传达。本工作提出一个兼容 OpenEnv 的强化学习环境,让 LLM 智能体学习通过工具使用来调研主题、规划内容并生成专业的 HTML 幻灯片演示。我们提出一个多组件奖励系统,结合结构校验、渲染质量评估、基于 LLM 的美学评分、内容质量指标,以及衡量生成幻灯片在多大程度上忠实传达其预期目的的逆向规范奖励。逆向规范奖励是一种“逆向任务”:由一个 LLM 尝试从生成的幻灯片中恢复原始规范,从而提供整体性质量信号。我们的方法通过 GRPO 微调 Qwen2.5-Coder-7B,仅训练 0.5% 的参数,提示来自使用 Claude Opus 4.6 收集的专家示范。在六个模型、48 份多样化业务简报上的实验表明,微调后的 7B 模型达到 Claude Opus 4.6 质量的 91.2%,较基础模型提升 33.1%。六模型对比揭示,决定智能体任务表现的是指令遵从与工具使用合规性,而非原始参数量。我们贡献了 SlideRL,一个涵盖全部六个模型、共 288 条多轮 rollout 轨迹的开源数据集:https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts 代码:https://github.com/pushing-the-frontier/slide-forge-llm

学会演示:面向智能体幻灯片生成的逆向规范奖励:论文配图
图1:系统架构:LLM智能体在训练循环中生成工具调用并由环境执行,多组分奖励引导策略优化,用于智能体幻灯片生成。