论文
通过 Stackelberg Games 进行多大语言模型协作协调
Multi-LLM Collaborative Alignment via Stackelberg Games
摘要
一组语言模型可以通过学习彼此的响应来协作和集体改进。这些交互取决于训练期间使用的说明。现有的方法通常对指令进行统一采样,尽管它们的有用性可能会随着模型的改进而改变:模型响应质量曾经不同的指令稍后可能会得到同样好的回答,而以前困难的指令可能开始提供有用的学习信号。我们提出了 Stackelberg Alignment,这是一种受博弈论启发的领导者-追随者框架,可将指令选择转变为适应性课程。 EXP3 强盗充当领导者,在指令之间分配固定的采样预算,并使用结合了指令难度和响应辨别性的奖励来更新其采样分布。语言模型充当追随者:它们响应选定的指令,评估彼此的响应,并通过 DPO 或 GRPO 从生成的偏好信号中学习。该框架使用 Elo 风格的声誉加权同行判断和基于声誉的对手匹配来支持可靠且有竞争力的模型交互。在三个异构模型池和涵盖科学发现、推理、代码、指令遵循和知识的 12 个基准测试中进行的实验表明,Stackelberg Alignment 在三个不同模型池中实现了最高的宏观平均水平,比最强的训练时间基线高出 7.4%,比最佳静态推理基线高出 12-25%。分析证实,适应性领导者将注意力集中在信息最丰富的指令上,而消融表明,声誉加权判断和基于声誉的匹配都提高了多大语言模型进化的有效性。