论文
将均值移向已知的善,而不是超越它:推理时间干预和权重合并在开放式生成中带来什么
Moving the Mean Toward the Known Good, Not Beyond It: What Inference-Time Interventions and Weight Consolidation Buy in Open-Ended Generation
摘要
一代循环从自身已验证的成功经验中获得什么收益?在在线装箱的生成、验证、选择和 LoRA 整合的循环中,对值过滤候选者的训练会将模型在保留变体上写入的内容转向价值(超出 -1.7 个点,p=0.008;相对于随机合并控制为 -3.1,p=0.004),而观察到的最佳候选者则收敛到经典启发式的水平,不再进一步。确认电池将整个过程重复三次,使用新鲜种子和从未咨询过的保留集仅读取一次:所有三个谱系的平均值几乎相同(-2.0、-1.8、-1.9),并且在保留变体中聚合后,所有七个可评估变体都倾向于合并(p = 0.008)。观察到的最好的候选者准确地达到了经典启发式的水平(在所有三个谱系中,对于吸引和随机控制都是 0.021028),并且从未超越它。匹配的仅 SFT 控制显示受监督的锚点,而不是来自不良候选者的排斥,进行集中(96% 的候选者完全达到经典启发式的水平)。尾巴是双向的:整合降低了每个候选者中优于经典候选者的比率(10%至3.9%),而其更大的产量绝对会产生更多这样的候选者(在少数事件中,5对1)。作为动机,我们报告了导致此处的推理时间分类账:模型编写的原理图回顾可以购买经过判断的文档集成,而没有任何东西可以购买开发;写入流中的验证器被模仿,每个笔记本有 16.4 条伪造的判决行。有效候选人的平均质量是可以购买和复制的;观察到的最好的都是经典,到目前为止,从未超越它。