论文
SpeedrunBench:用游戏速通挑战长程 Agent 学习
SpeedrunBench: Challenging LLM Agents with Video Game Speedrunning
摘要
Frontier LLM 智能体已被证明能够解决日益复杂的任务,而人类对此有可衡量的解决方案。这就引出了一个相关问题:LLM 智能体是否可以超越人类已经解决的问题。制定复杂策略来解决后续问题的能力变得至关重要,因为人们熟悉的、人类开发的解决方案不足以解决我们缺乏背景或足够的训练数据的问题。我们通过视频游戏速通的集体实践来研究智能体形成这种策略的能力。在速通中,从业者竞相寻找在特定条件下完成视频游戏的最快方式,并在此过程中发现有趣的非正统游戏风格,这些风格需要彻底理解和掌握基本的游戏机制。我们推出 SPEEDRUNBENCH,这是一个评估 9 种不同游戏的前沿 LLM 智能体的基准测试。为了在这个基准测试中表现出色,智能体必须反复改进他们的策略,反思他们的表现,利用他们所获得的知识,并在长期的行动中进行推理,以改进一个日益困难的问题:比自己和其他人更快。我们的实验表明,虽然前沿智能体在简单的平台游戏中接近人类世界纪录,但在实际预算下,它们在更长、更复杂的游戏中仍然落后于人类表现。这些结果表明,SPEEDRUNBENCH 是研究智能体策略形成能力的有用测试平台,也是一种抗饱和评估措施,因为几乎总是有更快的完成时间等待被发现。
