论文
面向LLM的Manim动画生成的训练与智能体推理策略
Training and Agentic Inference Strategies for LLM-based Manim Animation Generation
摘要
使用Manim等库生成程序化动画对大语言模型(LLM)提出了独特挑战,需要空间推理、时序排序,以及熟悉在通用预训练数据中代表性不足的领域特定API。当前研究缺乏对训练与推理策略在此场景下如何相互作用的系统性研究。本研究提出ManimTrainer——一个将监督微调(SFT)与基于强化学习(RL)的组相对策略优化(GRPO)相结合的训练流水线,其使用融合代码与视觉评估信号的统一奖励信号;以及ManimAgent——一个以渲染器在环(RITL)和API文档增强RITL(RITL-DOC)策略为特色的推理流水线。利用这些技术,本研究首次对基于Manim的文本-代码-视频转换进行了统一的训练与推理研究。研究使用ManimBench在九种训练与推理策略组合下评估了17个30B以下的开源LLM。结果显示,SFT普遍提升代码质量,而GRPO增强视觉输出,并提高模型在推理时自我修正过程中对外部信号的响应性。结合GRPO与RITL-DOC的Qwen 3 Coder 30B模型取得最高综合性能,渲染成功率(RSR)达94%,与参考视频的视觉相似度(VS)达85.7%,在VS上超过基线GPT-4.1模型3个百分点。此外,分析表明代码与视觉指标之间的相关性随SFT和GRPO增强,但随推理时增强而减弱,凸显了训练与智能体推理策略在Manim动画生成中的互补作用。
