论文

自修管道产能配置不对称

Asymmetric Capacity Allocation in Self-Refinement Pipelines

模型推理测试时计算扩展

摘要

自我细化通常被构造为生成、批评和修订,是一种广泛采用的用于改进 LLM 生成的范例,并且是许多 LLM 代理的核心机制。虽然这三个阶段涉及不同的认知需求,但大多数现有方法方便地将模型大小视为实现细节而不是研究主题,这可能会导致资源浪费。很少有工作系统地研究模型大小如何影响每个阶段,或者有效的自我完善是否需要同样有能力的模型来生成、批评和修改。我们使用 Qwen3 的 6 个模型大小和 Gemma 3 的 4 个模型大小,在来自不同领域的 5 个基准上提出了自精炼管道的第一个阶段模型大小研究。我们得出的结论是,较大的生成器和精炼器通常会改善管道,而尺寸过小的精炼器甚至会损害性能。其次,表现对批评者的规模高度不敏感,尽管即使是包括一个小批评者也始终优于完全忽略批评。我们的研究结果表明,模型容量不应在自我完善管道中统一分配。相反,不同的阶段表现出不同的尺寸缩放特征,为设计计算效率更高的多阶段语言模型系统提供了实用指导。