论文
哪些模型可以很好地协同工作?衡量大语言模型团队选择的异质性
Which Models Work Well Together? Measuring Heterogeneity for LLM Team Selection
摘要
LLM团队的绩效上限不仅受到个体模型能力的限制,还受到成员间误差共振和预测差异的限制。尽管异构团队在实践中经常被认为是有效的,但现有方法缺乏可计算、可解释和可优化的互补性指标,导致团队组成只能依赖启发式方法。我们提出了一种异质性驱动的团队选择框架,该框架执行离线分析来描述个人能力以及两个互补信号:一个捕获错误模式中的去相关性以减少共同失败,而另一个则测量预测行为的差异以捕获策略多样性。我们将团队选择制定为标准化的质量互补组合目标,并应用有效的贪婪搜索从候选池中选择一个小团队。跨多个基准的实验表明,我们的框架在受控的候选人库和团队规模下始终优于仅质量基准,为多大语言模型系统建立了可重用的选择原则。