使用经过验证的代码世界模型进行世界时间计算
World-Time Compute with Verified Code World Models
摘要
LLM 只有在看到许多真实的、带标签的示例后才能在整个域中进行概括,而大多数域都缺乏这些示例。我们研究一种廉价制造它的方法。当一个领域的动态可以写成代码时,一个模板就会实例化为许多世界模型:符号状态上的可执行、可验证的程序,每个程序都是精确标记的轨迹的取之不尽用之不竭的来源。 微调 和 LLM 在穿过许多这样的世界的轨迹上,我们称之为世界时间计算,测试时间计算的训练时间模拟,将泛化提升到从未训练过的保留世界(合成世界族)。在能力最稀缺的地方收益最大:0.5B 时+29 点;最大模型的升力在噪声范围内,与饱和度一致。标签是可信的,因为世界是经过验证的代码:合成后检查的动态在 20 步部署中是精确的,并准确地回答 10 倍分布外探测 (100%),而每步 LLM 和 MLP 预测器会复合错误和崩溃。与域随机化不同,每个世界都是独立创作和验证的;损坏的标签控件显示标签的准确性,而不是任务的多样性,推动了收益。在真实基准(ARC-AGI 网格、列表函数、CLRS)上,相同的杠杆与每个世界的测试时间训练相同。在列表函数上,更难的跨世界形式成立:在 128 个不相交的世界上训练的一个适配器在保留的世界上达到 40%,而在损坏的标签控制中达到 6%(+34 点,CI [29, 39])。增益是饱和规律,而不是规律:对于少步推理和小/弱模型来说增益最大,对于长链、感知引发的任务和饱和任务则衰减;如果没有共享技能,跨任务转移就会很弱。 Worlds 由零依赖框架 OpenWorld 编写和提供服务(配套论文)。范围:象征性状态;像素本机域仍然是学习模型的领域。所有代码、配方和本手稿均从一个存储库重新生成。