论文
FactorSmith:基于马尔可夫决策过程分解与规划器-设计器-批评家精炼的智能体仿真生成
FactorSmith: Agentic Simulation Generation via Markov Decision Process Decomposition with Planner-Designer-Critic Refinement
摘要
由于大语言模型(LLM)在面对庞大且相互关联的代码库时推理能力有限,从自然语言规格生成可执行仿真仍是一个具有挑战性的问题。本文提出 FactorSmith,一个从文本描述合成可玩游戏仿真代码的框架,它结合两个互补思想:以因子化 POMDP 分解实现有原则的上下文缩减,以及以分层规划器-设计器-批评家智能体工作流在每一步生成中进行迭代式质量精炼。借鉴 FactorSim [Sun et al., 2024] 引入的因子化部分可观测马尔可夫决策过程(POMDP)表示,所提方法将仿真规格分解为模块化步骤,每个步骤只在相关状态变量的最小子集上运行,从而限制任何单次 LLM 调用必须处理的上下文窗口。受 SceneSmith [Pfaff et al., 2025] 智能体三重架构的启发,FactorSmith 在每个因子化步骤中嵌入三智能体交互:协调工作流的规划器、提出代码产物的设计器,以及通过结构化评分评估质量的批评家,从而支持带检查点回滚的迭代精炼。本文对组合方法进行形式化,给出支撑上下文选择与智能体精炼的数学框架,并描述开源实现。在 PyGame Learning Environment 基准上的实验表明,与非智能体的因子化基线相比,FactorSmith 生成的仿真在提示对齐上更佳、运行时错误更少、代码质量更高。
