论文

思想空间的演变:训练测试时的小模型解锁更好的发现

Evolving in Thought Space: Training a Small Model at Test Time Unlocks Better Discoveries

模型推理测试时计算扩展

摘要

开放式科学发现通常需要反复提出和评估候选解决方案。基于LLM的系统可以通过根据验证者的反馈生成和完善可执行解决方案来支持此过程。 TTT-Discover 等方法使用测试时训练 (TTT) 从验证者反馈中更新解决方案生成LLM,调整其生成策略以改进目标问题的后续建议。然而,当可靠执行需要大型模型时,这会变得昂贵,因为训练必须维护梯度、优化器状态和策略统计数据,同时重复生成长的结构化输出。它还使信用分配变得复杂:结果级别验证者的反馈必须共同评估高层策略及其低层实施。在这项工作中,我们引入了 Guidance-TTT,它将这些角色分开。紧凑的指导模型在测试时进行训练,以提出高级战略变更,而冻结执行模型将它们实现为完整的可执行解决方案。在每一步中,系统都会选择一个有前途的先前发现的解决方案,提出更改,执行和验证它,并使用自适应组相关 RL 目标仅更新指导模型。这将测试时的学习集中在短期战略决策上,同时保留了更强大模型的实施能力,而无需对其进行调整。在没有网络访问的情况下,Guidance-TTT 可以在四个不同的领域提供强大的解决方案:组合优化(Polyomino Packing)、启发式编程(AHC058)、机器学习(Lasso)和 GPU 内核优化(TriMul)。在这些任务中,它的性能优于之前工作中报告的最佳解决方案,同时与公共在线排行榜上的最新结果保持竞争力。代码可在 https://github.com/Human-Agent-Society/reef/tree/guidance-ttt-support. 获取