论文
PRISM:程序化时空推理基准
PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
摘要
通过代码进行程序化视频生成可提供超越像素级扩散模型的几何精度与时序一致性,然而严格评估语言模型能否生成空间正确的动画输出仍是未解问题。我们提出PRISM,一个包含10,372个人工校准指令-代码对的大规模基准(比先前的程序化视频生成基准大20倍),根植于中英文的真实世界知识可视化场景,横跨437个学科类别。我们进一步提出漏斗式评估框架,包含四个互补指标:面向可执行性的代码级可靠性(Code-Level Reliability)、面向完整动画序列布局正确性的空间推理(Spatial Reasoning),以及用于诊断动态表现力与时序活动性的提示感知动态视觉复杂度(PADVC)和时序密度(TD)。对七个主流LLM的系统评估揭示出显著的执行-空间鸿沟(Execution-Spatial Gap):从执行成功率到空间通过率的平均下降约为41%,表明可运行的代码未必产生空间连贯的视觉输出。这些发现表明,程序化视频生成的评估应超越可执行性。PRISM为推进空间连贯的代码生成提供了一个有原则的基准。
