论文

SIMMER:使用世界模型对 LLM 可执行规划中的潜在故障进行基准测试

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地被部署为家庭环境中自主代理的规划器。虽然现有基准评估 LLM 生成的计划是否成功执行,但它们忽略了一种关键的故障类型:潜在故障。与在执行时触发即时反馈并能够及时纠正的即时故障不同,潜在故障不会立即停止计划执行,而是默默地损害目标的实现。在严重的情况下,它们会造成不可逆转的伤害。为了解决这一差距,我们引入了 SIMMER,这是一个通过基于厨房领域的人工策划的符号世界模型来评估 LLM 规划中潜在失败的基准。 SIMMER 定义了一个世界模型,其中包含 77 个动作、262 个独特对象以及大约 46,800 个可能的交互,这些交互在语义上是真实的,源自现实世界的烹饪脚本。然后,它利用状态机执行器根据世界模型验证计划并检测立即的前提条件违规、潜在危险和不可逆转的故障。六个 LLM 的实验表明,即使是前沿模型也最多能实现 17% 的无错误计划。此外,高达 56% 的计划包含潜在的失败,其中大多数会导致不可逆转的后果。我们进一步证明,通过反事实前瞻模拟进行显式状态推理可以将潜在故障减少高达 72%,将不可逆转的情况减少高达 75%,这为更强大的 LLM 规划者提供了一个有前途的方向。