论文

当经验证的世界模型仍然输:LLM合成代码世界模型中的可玩充分性与预测准确性

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

模型评测评测方法与指标

摘要

大语言模型能把游戏规则合成为可执行代码——代码世界模型(CWM)——随后经典规划器在其上搜索。此类模型通常在采样轨迹上达到高转移准确率即被接受。我们论证对规划而言这是错误的充分性概念。我们证明四件事。(1) LLM合成的CWM可以在采样门控上达到100%转移准确率、且在规划器自身搜索分布上达到≥98%的状态准确率,却在对局中系统性失败——因为它错的<1%恰是关键动力学;被省略规则的对局代价为0.091(种子聚类95% CI [0.065,0.117],n=4800)。我们称之为“经验证对正确”差距,并端到端经合成管线确认。(2) 危害遵循定量定律 danger=play_cost×(1-rarity)^N,其(1-rarity)^N门漏因子被证明精确、对局代价有经验界。(3) 该失败不被更多数据修复:LLM合成的行为是规则翻译而非规则推断——跨模型(GPT-5.x)与数据regime(含DAgger与定向样例)都未推断出被省略的规则。(4) 同一机制在不完全信息CWM的信念推断函数上重现:我们证明覆盖界(大小N的门在N≳b^{d_max}时可识别),解释为何库恩扑克等浅博弈没有差距,并手工构造Beacon——一个通过门控却每局必输的“经验证但错误”推断函数。结果提示:面向规划的世界模型的充分性应在搜索分布上或直接按对局度量,而非按采样转移的预测准确率。