论文
EnvSimBench:评测与改进基于LLM的环境仿真
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
摘要
可扩展的人工智能代理训练依赖于忠实模拟代理行为后果的交互式环境。手工制作的环境构建成本昂贵,扩展起来很脆弱,并且多样性从根本上受到限制。一个有希望的方向是用LLM模拟的环境来取代手动制作的环境。然而,这种范式取决于一个未经检验的核心假设:LLM可以准确地模拟环境反馈。在实践中,LLM 模拟的环境会遭受幻觉、逻辑不一致和无声状态漂移故障的困扰,这些故障会破坏代理奖励信号并加剧范式旨在消除的构建成本。为了弥补这一差距,我们提出了 EnvSimBench,它有四个贡献:1)我们提供了环境模拟能力(EnvSim 能力)的第一个正式定义和可操作化,作为可量化的研究目标。 2) 我们构建了 EnvSimBench,这是一个严格的基准测试,涵盖 167 个不同环境中的 400 个样本,配备可验证的标签和沿三个轴的细粒度难度分层。 3)系统评估表明,所有最先进的语言模型都遭受普遍的状态变化悬崖:当环境状态保持不变时,它们在任务上实现近乎完美的准确性,但当多个状态需要同时更新时,它们会灾难性地失败。这一发现暴露了 EnvSim 能力是一个关键但很大程度上尚未解决的能力差距。 4)我们设计了一个约束驱动的模拟管道,可以大大减少幻觉,将环境合成良率提高6.8%,并将成本降低90%以上。总体而言,EnvSimBench 既可作为诊断框架,又可作为可靠的基于 LLM 的环境模拟的实用优化路径,为可扩展的代理训练奠定基础。代码和数据可在 https://github.com/cookieApril/EnvSimBench 获取
