论文

SGA:面向教育视频合成的即插即用几何验证

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

模型推理推理验证与自校正

摘要

近期工作利用大语言模型(LLM)以Manim等库生成教学动画的可执行代码。但确保空间正确性与视觉可读性仍是挑战:现有框架强调教学内容而忽视几何遮挡。我们提出符号几何智能体(SGA),一个面向以代码为中心的动画管线的即插即用模块:拦截LLM生成的代码,执行部分执行以抽取符号场景图,并在检测到空间冲突时做定向精炼。我们进一步提出Manim视觉质量分数(MVQS),一个确定性的、无需渲染的空间完整性代理指标。在MMMC-Code基准上、跨四个LLM底座与两条智能体管线的实验显示:SGA取得峰值MVQS 73.11(Code2Video+GPT-5.1),相对原始基线提升16.1%,并在8个底座×管线组合中的7个改善MVQS。

SGA:面向教育视频合成的即插即用几何验证:论文配图
图 1:当前的 SOTA 代理可生成语法上有效但视觉上被遮挡的动画。 (左)TheoremExplainAgent Ku 等人。 (2025) 忽略了空间限制,而 Code2Video Chen 等人。 (2025)依赖于随机的、计算成本高昂的 VLM 反馈,无法解决细粒度的冲突。 (中)这种确定性基础的缺乏会导致像素空间中的“几何幻觉”。 (右)我们的 SGA 支持符号场景图提取和有针对性的细化,在渲染之前通过设计确保空间完整性。