论文

FactorSmith:基于马尔可夫决策过程分解与规划器-设计器-批评家精炼的智能体仿真生成

FactorSmith: Agentic Simulation Generation via Markov Decision Process Decomposition with Planner-Designer-Critic Refinement

智能体系统上下文与知识上下文工程Agent 协作Agent Harness

摘要

由于大语言模型(LLM)在面对庞大且相互关联的代码库时推理能力有限,从自然语言规格生成可执行仿真仍是一个具有挑战性的问题。本文提出 FactorSmith,一个从文本描述合成可玩游戏仿真代码的框架,它结合两个互补思想:以因子化 POMDP 分解实现有原则的上下文缩减,以及以分层规划器-设计器-批评家智能体工作流在每一步生成中进行迭代式质量精炼。借鉴 FactorSim [Sun et al., 2024] 引入的因子化部分可观测马尔可夫决策过程(POMDP)表示,所提方法将仿真规格分解为模块化步骤,每个步骤只在相关状态变量的最小子集上运行,从而限制任何单次 LLM 调用必须处理的上下文窗口。受 SceneSmith [Pfaff et al., 2025] 智能体三重架构的启发,FactorSmith 在每个因子化步骤中嵌入三智能体交互:协调工作流的规划器、提出代码产物的设计器,以及通过结构化评分评估质量的批评家,从而支持带检查点回滚的迭代精炼。本文对组合方法进行形式化,给出支撑上下文选择与智能体精炼的数学框架,并描述开源实现。在 PyGame Learning Environment 基准上的实验表明,与非智能体的因子化基线相比,FactorSmith 生成的仿真在提示对齐上更佳、运行时错误更少、代码质量更高。

FactorSmith:基于马尔可夫决策过程分解与规划器-设计器-批评家精炼的智能体仿真生成:论文配图
图 1:FactorSmith 的架构。游戏提示首先通过思想链分解为模块化步骤。每个步骤都由状态代理(规划者/设计者/评论家三人组)处理,该状态代理识别相关的新状态变量,仅从会话数据库中选择上下文子集。然后,分解代理将步骤拆分为三个 MVC 组件:输入逻辑、状态转换和 UI 渲染,每个组件都由自己的代理三重奏(输入逻辑代理、逻辑代理、UI 代理)处理。所有生成的函数和状态变量都保留在会话数据库中,从而为后续步骤启用因子上下文选择。