论文

玩维基百科摘要中的 log(N)-问题:信息不对称下每轮错误如何复合

Playing log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound Under Information Asymmetry

智能体系统Agent任务评测

摘要

我们在双智能体 $\log_2 N$-Questions 游戏(Potash 等人,2019)上评估了六种前沿语言模型,以衡量信息不对称情况下的自我沟通。有权访问 $N$ 候选维基百科主要段落($N = 4$ 到 $1024$)的提问者必须使用来自同一提供商且仅看到目标的代理回答的 $\log_2 N$ 二进制问题来识别秘密目标。在 408 场比赛中,胜率随着地平线长度 $p^{\log_2 N}$ ($p \approx 0.93$) 的几何幂而明显衰减。每轮失败率在整个范围内持平,这表明错误会复合,因为更多的轮次必须成功,而不是因为单个轮次变得更加困难。三位独立法官的裁决表明,损失分为单智能体回答错误和辨别失败,这在双智能体结构下变得不可检测和不可恢复,而不是渠道崩溃。 Claude Opus 5 由于系统性假阴性答案(82% 的答案错误)而落后,而五个领先模型(GLM-5.3、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash 和 Kimi K3)则紧密聚集在一起。最大化信息增益需要结构分区(例如,文档标题的拆分),并且推理词元支出和 API 成本都与成功无关($r = -0.05$),这凸显了通信可靠性是推理计算的一个明显瓶颈。