论文
GPTNT:在Keep Talking And Nobody Explodes上基准测试多模态智能体的实时协作
GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes
摘要
多模态模型日益被部署为与人类或其他人工智能体协作解决任务。虽然既有基准表明它们具备基础能力——但协作时同时出现的各种条件——时间压力、信息不对称与不完美沟通——传统上被孤立研究。为填补该缺口——我们介绍GPTNT——建立在合作视频游戏Keep Talking And Nobody Explodes上的基准:两个智能体必须协作拆除程序生成的炸弹谜题——对抗实时倒计时。一个智能体看得见炸弹但没有拆弹说明;另一个持有说明但看不见也无法操作炸弹。任何一方都无法单独成功:任务需要双方贡献——且只能经有效高效的沟通解决。我们移除回合制代理或简化——要求智能体异步行动并实时沟通。GPTNT旨在暴露模型如何协作而非如何单独表现:说明书、搭档或两者都可选择性地隐藏——以浮现模型记住了什么 versus 当下推导了什么。我们表明GPTNT对SOTA构成相当挑战:我们测试的闭源与开源模型没有一个实时拆除一枚炸弹——而人类玩家能过此线。在一系列受控实验中——我们探索能力在哪里崩溃——识别状态追踪、时间预算内高效行动、处理歧义与错误恢复中的关键弱点。由于它运行在真实游戏上——GPTNT受益于程序生成并继承活跃的模组社区:随模型改进——基准可演化以保持挑战——而非被解出一次即退役。
