论文

CivBench:《文明VI》中工具介导智能体的长程基准

CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI

智能体系统智能体互操作协议Agent任务评测MCP长程任务评测

摘要

我们推出了 CivBench,这是一个开源基准测试,用于通过模型上下文协议 (MCP) 在长期、工具介导的环境中评估语言模型代理。单个情节跨越 300 多个回合,并在大型动作空间中产生数千个工具调用,需要持续规划、状态监控和部分可观察性下的执行。该环境公开了 76 个 MCP 工具和一个将视觉游戏状态转换为结构化文本的叙述层。我们使用 CivBench 来表征 23 次可接受的运行中四个模型系列的代理行为。该样本是一个试点,而不是模型排名:总体结果并不能可靠地区分这种规模的模型。相反,我们引入了环境可测量的两个接口级指标:主动监控率(PMR),捕获代理是否主动查询潜在策略状态;以及 RAG@10,捕获结构化规划反射中规定的承诺是否在随后的十轮内执行。在整个运行过程中,我们在共享剧本协议下观察到两种一致的模式。智能体对可用但需要明确查询的战略相关状态进行监控:尽管剧本指导每 20 回合查询一次胜利进度,但智能体仅每 30 到 75 回合这样做一次,并且在 20 次可检测到的失败中,有 7 次他们未能在游戏结束前的 20 回合警告窗口内进行查询。代理商也经常无法执行自己的规划反思中规定的近期承诺(RAG@10 各模型的比例在 48.2% 到 65.8% 之间)。尽管有工具访问和明确的指导,这两种模式都会出现,我们将它们解释为指导下的偏差,而不是能力的缺乏。我们在 https://github.com/lmwilki/civ6-mcp 发布了环境、场景、日志、指标和分析管道

CivBench:《文明VI》中工具介导智能体的长程基准:论文配图
图1: 示范背景协议(MCP)结构。智能体商通过 MCP 工具进行互动;服务器将呼叫转换到 Civilization VI, 通过解说层返回结构化观测。(第3条)