论文
LLM 团队可以玩什么?在哪里?什么时候?
Can LLM Teams Play What? Where? When?
摘要
大语言模型 (LLM) 在需要间接推理、文化知识和协调假设检验的任务上仍然受到限制。我们研究了基于团队的交互是否可以提高 LLM 在《什么?》中的表现。在哪里?什么时候? (ChGK),一款旨在奖励集体推理的问答游戏。我们介绍三种团队策略:投票、沉默团队(队长观察最终答案)和多嘴团队(队长观察答案和理由)。为了最大限度地减少数据泄漏,我们在由 2025 年发布的 572 个 ChGK 问题组成的数据集上评估了这些策略。使用六个最近的大规模开放模型,我们表明基于团队的策略优于单模型基线,准确率提高了高达 20 个百分点。最好的团队达到了 44.23% 的准确率,并且通过可用的人类统计数据在问题上接近人类团队的表现。对模型间多样性的分析表明,分歧强烈预示着准确性较低,但解释性沟通可以大大缓解性能下降。我们进一步检查了船长的行为,没有发现自我偏好偏见的证据;获得同伴的理由可以提高队长的判断力。总体而言,LLM 团队的主要功能是答案选择和错误过滤机制,而不是新颖解决方案的生成器。我们的研究结果强调了交互的重要性,并提出自适应策略作为多智能体系统的一个有前途的方向。