论文

GEST 引擎:从事件图到合成视频。完整的技术报告

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

模型训练合成数据

摘要

我们推出了 GEST-Engine,这是一个从自然语言文本到完全注释的多演员视频的完整系统。其核心是一个明确的世界模型:引擎不是将状态编码为学习的潜在变量,而是维护一个完整的、可检查的世界表示(哪些参与者存在,他们在哪里,他们在做什么,他们持有哪些对象,以及事件在时间和空间上的关系),表达为正式的时空事件图(GEST),并在通过开源多人脚本框架驱动的商业游戏引擎的开放世界中确定性地实现。 GEST 可以按程序生成,也可以通过代理文本到 GEST 系统生成,其中 LLM 总监通过由编程状态后端验证的工具调用来计划故事,因此每个生成的规范都可以通过构造执行。然后,GEST 进入四阶段执行管道:图形解析和验证、实体和动作与环境的对应、时间编排(由 Floyd-Warshall 传递闭包解决的艾伦式约束)以及执行和捕获。在单次模拟过程中,引擎会发出帧对齐的 RGB 视频、密集的每像素深度、实例分割、每演员骨骼姿势、每帧成对空间关系图、2D 边界框、事件到帧时间映射和自然语言描述,所有这些都是零边际注释成本。我们进一步描述了游戏内世界编辑器、运行时能力提取、文本生成管道以及跨并行虚拟机大规模渲染语料库的生产系统。由于每一帧都可以追溯到语义规范,因此该引擎通过构造保证了对象持久性、多参与者协调和时间一致性,使其输出成为视频理解的训练数据、评估基准和诊断工具。