论文

多采样,少反思:自我完善和反思输给了同等词元成本下的重复采样,从 1.5B 到 7B

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

模型评测评测方法与指标

摘要

制定语言模型计划、批评和重写自己的答案、反思错误、选择几次尝试中最好的、或与自身副本进行辩论的方法几乎都使其生成比单一思想链多得多的文本。由于生成更多文本本身就可以提高准确性,因此对一条思路的增益并不表明该方法的想法有帮助。王等人。 (2024)报告称,一旦预算具有可比性,简单的基线,即重复对同一问题进行采样并保留最常见的答案,通常会获胜,但给出的点估计没有置信区间或显着性检验。我们将这种比较作为设计实验重新运行:七种方法,1.5B、3B 和 7B 参数的开放模型,两个数学基准,每个 150 个问题。我们计算每个生成的词元,包括用于批评、反思、辩论轮次和检查的词元,并将每种方法与以其自己测量的成本进行重复采样进行比较。所有 36 个比较均按问题配对,并具有引导区间和多重校正。没有任何方法比在任何地方以同等成本重复采样更可靠。有 10 种确实更差,所有这些方法都由模型检查自己的输出,并且所有 18 种自检比较都是负面的。随着模型的发展,这两种自我检查会逐渐分离。选择不再带来伤害:采用 Best-of-N 的 8 个样本,仅计算最常见的答案节拍,让模型在 1.5B 处选择 8.0 和 11.3 点,但在 7B 处仅选择 2.0 和 1.3 点,不再与零区分开。重写无法恢复:自我精炼和强制反射在 7B 处比基线低 3.6 到 10.1 点。发布的反射从未触发其在最小模型上的重试。它每次都判断自己是正确的,然后默默地成为一条思绪。我们发布代码、提示、所有代以及我们的验证脚本。