论文

LLM编排何时划算?准确率、成本与任务难度的受控评估

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

模型评测模型能力评测

摘要

LLM orchestration通常被认为能通过分配额外的推理时间计算来改善推理,但其收益可能不值得其成本。现有的比较也经常忽略优化努力的差异,使得难以单独评估orchestration的价值。我们对Self-Refine、Best-of-$N$和Debate与任务单独和链式思维(CoT)单个调用基准线进行控制评估,跨五个LLM后端和三个领域(竞争编程、棋盘游戏谜题和数学)进行比较:优化每个方法时使用GEPA,并在相同的难度分层基准项上评估所有方法。orchestration在所有LLM后端上产生中等但基准依赖的收益:在每个基准项内,平均而言,最大的改进是优化CoT推理的4.6个百分点,而任务单独推理的4.5个百分点,同时要求大约2到4倍于任务单独推理的平均总令牌数。人类难度与所有三个基准项中的绝对准确度呈负相关,但同一基准项内的分析表明,orchestration效果不受任务难度的影响。相反,探索性的混合效应分析揭示了所有三个基准项中orchestration方法与模型后端之间的强交互作用,表明orchestration效果取决于底层模型。我们的结果表明,orchestration决策应基于模型并考虑适度准确度收益是否值得额外的推理成本。更广泛地说,LLMorchestration的评估应控制优化努力,并报告模型特定的准确度-成本权衡,而不是将额外的推理时间结构视为均等地有益。

LLM编排何时划算?准确率、成本与任务难度的受控评估:论文配图
图3:各基准上、针对每个模型的编排方式相对思维链(CoT)的配对准确率差值。每个单元格是该模型逐题差值的平均值,标签以百分点表示。