论文

为生活世界创作:用于可执行多参与者场景的工具受限 LLM 代理

Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

智能体系统Agent 动作执行与治理

摘要

为生动的 3D 世界创作多角色场景,其中每个动作都会改变其状态,并且每个动作的有效性都取决于之前积累的状态,这需要讲故事的自由性和模拟的严谨性。我们使用 LLM 代理编写此类场景,如时空事件图 (GEST),模拟引擎确定性地将其执行到具有每帧空间、时间和语义 真值 的叙事视频中。驱动旗舰 LLM(视频生成中的标准设计)的分阶段管道彻底失败:该模型违反了提示中逐字规定的规则,并且无法跟踪动态世界状态。我们用约束执行工具层来回答:我们的Director和Scene Builder代理逐页探索世界的功能,并通过针对模拟器状态检查的操作来构建每个场景,因此它们发出的每个规范在构建时都是有效的。因为我们从现有的场景图生成每个种子文本,所以我们可以测量重构:代理仅根据文本创建自己的图,但在其事件、每个动作及其参与者(同类随机场景为 0.55)以及其排序上为 0.77(0.43 随机),与原始图的 F1 匹配为 0.83。端到端:标准分阶段管道在 50 次尝试中产生了 0 个可执行规范;我们的代理驱动预算模型,执行 25 项中的 20 项(80%),据我们所知,他们是第一个充分发挥 GEST 表达能力的代理。