论文

更多节目还是更多卷?将大语言模型的覆盖范围与专业化分开

More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses

智能体系统Agent任务评测

摘要

自动生成 LLM 工具有望通过任务专业化来改进推理。然而,重复执行同一程序可能会产生额外的答案覆盖范围,从而使专业化难以识别。我们引入了一种受控评估,将答案覆盖率、可重复任务优势以及执行前选择的收益分开。在 386 个 MATH-500 任务中,我们将八个生成的工具加上一个基线与九个字节相同的基线副本进行比较,每个成员使用 3 次执行。相同的程序可产生 2.16 个百分点的重复平均预言机空间。生成的程序表现出明显更可重复的分数模式,但这些主要揭示了持续的弱点:相对于基线的损失在 100 个任务的所有 3 次重复中持续存在,而持续的胜利仅发生在一项任务上,并且对答案提取很敏感。冻结的选择器增加了 0.00 个百分点,并且在 27 次Harness执行中,两个群体都达到了 98.70% 的预言机覆盖率。三次重复时稳定的互补性仍未解决。支持 BIRD 跟踪定位机制实现、激活和输出有效性中的故障。总之,这些发现证明了为什么仅覆盖范围和可重复性不能证明有用的专业化的主张。它们激发了利用多样性的评估标准:任务优势应该在执行过程中持续存在,指导可用的决策,并在匹配的推理预算下改进额外的固定程序执行。