论文

ManiBench:测试Manim代码生成中视觉逻辑漂移与语法幻觉的基准

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

模型评测基准与评测资源

摘要

HumanEval和MBPP等传统基准能有效测试逻辑与语法,但当代码必须生成动态的教学可视化时便告失效。我们推出ManiBench,一个专门评估LLM生成Manim CE代码表现的基准,其中时间保真度与版本感知的API正确性至关重要。ManiBench瞄准两种关键失效模式:语法幻觉(Syntactic Hallucinations,引用不存在或已弃用Manim API的有效Python代码)和视觉逻辑漂移(Visual-Logic Drift,生成的可视化因时序错误或缺失因果关系而偏离预期的数学逻辑)。该基准包含150-200道跨五个难度级别的题目,涵盖微积分、线性代数、概率、拓扑和AI,并基于对3Blue1Brown的ManimGL源码(53,000行、143个场景类)的分析。评估采用四层框架,测量可执行性、版本冲突错误率、对齐分数和覆盖分数。一个开源框架可跨多个模型和提示策略自动评估。代码、数据和基准套件见 https://github.com/nabin2004/ManiBench,数据集托管于 https://huggingface.co/datasets/nabin2004/ManiBench。