论文
CollabBench:通过主动参与与不同玩家进行基准测试并释放 LLM 的协作能力
CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement
摘要
虽然基于 LLM 的代理在个人任务方面表现出色,但与现实的人类合作伙伴的有效协作仍然具有挑战性。大多数现有的对话级协作研究缺乏基础的交互和行为执行,这就激发了对能够实现情境化和沉浸式协作的合作游戏环境的需求。为此,本文提出了 CollabBench,一个用于评估和训练合作游戏中协作代理的基准。 CollabBench 具有多样化的玩家配置文件模拟管道,可对不同的玩家行为进行建模,以及协作代理训练范式,可通过代理执行轨迹统一推理、沟通和行动,并通过平衡任务效率和情感适应的混合奖励进行优化。我们进一步将经典环境扩展到CWAH-MultiPlayer和Cook-MultiPlayer,以在不同个性下进行系统评估。效率和情感指标的实验表明,我们训练的模型优于基础模型,效率提高了 19.5%,情感表现提高了 24.4%。进一步的分析揭示了现有模型的关键协作局限性,并为未来的协作训练提供了见解。