论文

办公室规模验证搜索中的运营商套餐、提议者实力和构建系列平台

Operator Packages, Proposer Strength, and Construction-Family Plateaus in Office-Scale Verified Search

模型推理推理搜索与路径规划

摘要

验证搜索,其中语言模型提出程序,硬评估器对它们进行评分,然后选择保留最好的,最近已经改变了数学记录;提议者侧组件的受控消融仍然很少见。我们在办公室规模上测试了一个最小的 FunSearch 式循环(笔记本电脑上的 30B 本地模型,每次运行 120-600 个经过验证的样本),其中包含三个操作包:模型编写和携带的示意图笔记本,而不是逐字精英、指定的障碍以及对已发现结构的行为排斥。对于公共存储库中的九个构建问题,具有两次重复的完整 2^3 阶乘有利于名义两阶段分析中的主要对比:该组合缩小了更多种子与记录之间的差距(+0.196;名义合并 p=0.023,阶段组合 p~0.08;每个问题效应中值+0.045)。排斥力提高了各处的构造哈希多样性(p=0.0039;部分是操纵检查)。阶乘没有发现正向记忆与排斥的相互作用(限制在+/-0.04左右);增益会相加地分解,并且记忆+排斥是唯一永远不会崩溃的臂(18 次运行中的 0 次),在完整组合的 0.025 范围内。在相同循环下,前沿提议器可以在数十个样本中达到本地模型在数百个样本中无法达到的效果;在单一范围运行中,无需操作符即可获得收益。在缩小了旗舰问题约 92% 的差距后,搜索陷入停滞,注册的家族提示测试给了这个停滞第一次解读:以文字命名,参考家族被采用并失败;作为代码,它已经过优化,但我们最好的有限网格实现仍然低于独立达到的平台。循环传输并优化了它所传递的想法;没有任何独立的跑步产生它。我们发布了Harness、每位候选人以及注明日期的预注册。