样本数量不够:候选人生成策略塑造了 LLM 测试时间扩展的能量和性能
Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
摘要
测试时间缩放可以通过生成和组合多个候选响应来改进大型语言模型推理。在基于采样的方法中,推理预算通常由生成的候选数 N 来描述。但是,N 告诉我们生成了多少个候选数,而不是它们是如何执行的。相同的候选预算可以在一次批量生成调用中生成,也可以在多个具有较小批量大小的连续调用中生成。我们首先使用 Phi-3-mini 和 Qwen2.5-1.5B 在 500 个 GSM8K 提示上研究增加 N 对推理准确性的影响。正如预期的那样,将 N 从 1 增加到 8 可将 Phi-3-mini 的准确度提高 8.4 个百分点,将 Qwen2.5-1.5B 的准确度提高 18.4 个百分点。然而,准确性本身并不能显示使用较大候选预算的系统成本。因此,我们固定 N = 8 并比较四个生成计划:1x8、2x4、4x2 和 8x1,其中 axb 表示每次调用有 b 个候选的生成调用。我们测量延迟、吞吐量、GPU 小时数和 GPU 设备总能耗,同时保持候选总数固定。在 A100 GPU 上,八个串行调用使用的 GPU 设备总能量是 4.64-4.86 倍,并且具有 8 个候选的一个批量调用的 P95 延迟的 5.77-6.12 倍。每个模型的三个独立调度的 A100 节点和短输出 SciQ/V100 实验中都会出现相同的模式。这些结果表明,仅候选计数不足以描述多候选测试时间扩展的系统成本。当候选者是独立的并且内存允许时,具有较大批量大小的更少的生成调用会更有效。因此,评估不仅应该报告候选数量和准确性,还应该报告生成时间表和 GPU 级系统指标。