论文
先看后写:为空间感知的教育动画生成学习视觉先验
See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation
摘要
大语言模型能为教育动画生成可执行代码,但渲染结果常出现视觉缺陷,包括元素重叠、错位与动画连续性中断。这些缺陷无法仅凭代码可靠检测,只有在执行后才显现。我们将该问题形式化为渲染反馈感知的约束代码生成:给定自然语言规格,模型必须生成可执行代码,其渲染输出满足只能在渲染后评估的结构化质量标准。为解决这一问题,我们提出OmniManim,一个围绕共享场景状态、显式视觉规划、结构化渲染后诊断与局部化修复构建的渲染反馈感知教育动画生成框架。在OmniManim中,视觉智能体(Vision Agent)是任务特定的视觉规划模块:它以由粗到细的边界框去噪预测稀疏关键帧布局,并优化插值感知目标,以减少下游动画插值引发的中间帧失败。我们进一步构建两个数据集ManimLayout-1K与EduRequire-500,并提供覆盖可执行性、教学质量、视觉质量与效率的可复现评估协议。在EduRequire-500上,OmniManim的实测渲染质量优于单模型基线与现有多智能体框架。系统消融研究进一步验证,显式视觉规划——尤其是其粗空间先验、边界框精化与插值感知优化——是这些增益的核心。
