论文

GPTNT:在Keep Talking And Nobody Explodes上基准测试多模态智能体的实时协作

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

智能体系统Agent任务评测

摘要

多模态模型日益被部署为与人类或其他人工智能体协作解决任务。虽然既有基准表明它们具备基础能力——但协作时同时出现的各种条件——时间压力、信息不对称与不完美沟通——传统上被孤立研究。为填补该缺口——我们介绍GPTNT——建立在合作视频游戏Keep Talking And Nobody Explodes上的基准:两个智能体必须协作拆除程序生成的炸弹谜题——对抗实时倒计时。一个智能体看得见炸弹但没有拆弹说明;另一个持有说明但看不见也无法操作炸弹。任何一方都无法单独成功:任务需要双方贡献——且只能经有效高效的沟通解决。我们移除回合制代理或简化——要求智能体异步行动并实时沟通。GPTNT旨在暴露模型如何协作而非如何单独表现:说明书、搭档或两者都可选择性地隐藏——以浮现模型记住了什么 versus 当下推导了什么。我们表明GPTNT对SOTA构成相当挑战:我们测试的闭源与开源模型没有一个实时拆除一枚炸弹——而人类玩家能过此线。在一系列受控实验中——我们探索能力在哪里崩溃——识别状态追踪、时间预算内高效行动、处理歧义与错误恢复中的关键弱点。由于它运行在真实游戏上——GPTNT受益于程序生成并继承活跃的模组社区:随模型改进——基准可演化以保持挑战——而非被解出一次即退役。

GPTNT:在Keep Talking And Nobody Explodes上基准测试多模态智能体的实时协作:论文配图
图 1:《Keep Talking》和《Nobody Explodes》中交互的高级概述。两名智能体必须在信息不对称和实时压力下协调解决一系列谜题:拆弹者可以看到炸弹但没有手册,而专家有手册但看不到炸弹。