论文

EnvSimBench:评测与改进基于LLM的环境仿真

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

模型评测基准与评测资源

摘要

可扩展的人工智能代理训练依赖于忠实模拟代理行为后果的交互式环境。手工制作的环境构建成本昂贵,扩展起来很脆弱,并且多样性从根本上受到限制。一个有希望的方向是用LLM模拟的环境来取代手动制作的环境。然而,这种范式取决于一个未经检验的核心假设:LLM可以准确地模拟环境反馈。在实践中,LLM 模拟的环境会遭受幻觉、逻辑不一致和无声状态漂移故障的困扰,这些故障会破坏代理奖励信号并加剧范式旨在消除的构建成本。为了弥补这一差距,我们提出了 EnvSimBench,它有四个贡献:1)我们提供了环境模拟能力(EnvSim 能力)的第一个正式定义和可操作化,作为可量化的研究目标。 2) 我们构建了 EnvSimBench,这是一个严格的基准测试,涵盖 167 个不同环境中的 400 个样本,配备可验证的标签和沿三个轴的细粒度难度分层。 3)系统评估表明,所有最先进的语言模型都遭受普遍的状态变化悬崖:当环境状态保持不变时,它们在任务上实现近乎完美的准确性,但当多个状态需要同时更新时,它们会灾难性地失败。这一发现暴露了 EnvSim 能力是一个关键但很大程度上尚未解决的能力差距。 4)我们设计了一个约束驱动的模拟管道,可以大大减少幻觉,将环境合成良率提高6.8%,并将成本降低90%以上。总体而言,EnvSimBench 既可作为诊断框架,又可作为可靠的基于 LLM 的环境模拟的实用优化路径,为可扩展的代理训练奠定基础。代码和数据可在 https://github.com/cookieApril/EnvSimBench 获取

EnvSimBench:评测与改进基于LLM的环境仿真:论文配图
图 1:EnvSimBench 概述。模块 A:EnvScaler Song 等人。 (2026)环境作为种子数据; GPT-4o-mini 代理收集多轮执行轨迹,预处理为独立的单轮状态预测样本 (st,at,st′,ot)(s_{t},a_{t},s^{\prime}_{t},o_{t})。每个步骤都可以根据编程标签进行独立验证,将模拟保真度与状态跟踪分离,并使 EnvSim 能力客观可测量。模块 B:样本经过三轴分层(动作结果、状态变化复杂性、参数基数)和基于执行器的标记,在 167 个环境中生成 400 个基准样本。这三个轴可以精确定位故障,而不是分解为单个分数。模块 C:路径 1 在相同条件下评估七个前沿LLM。路径 2 训练专门的 4B 仿真模型,当集成到 EnvScaler 中时,可将合成产量提高 6.8%,同时将成本降低 90% 以上。