论文
基于可验证奖励的程序学习:用于大语言模型后训练的符号反向传播
Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs
摘要
对语言模型进行推理训练意味着更新其权重。有监督微调和强化学习都将获得的能力置于模型内部,无法检查,无法逐步检查,也无法转移到另一个模型。我们认为,对于中间步骤允许验证的任务,推理最好放置在基本模型权重之外,作为由确定性和神经基元组成的显式程序。我们引入 PLVR(可验证奖励的程序学习):一种直接从输入输出示例中学习此类程序的后训练方法。它的机制是符号反向传播:每个程序层都带有一个类型化本体,在输出处根据真实情况计算损失,并且所需的输入本体通过原始签名的类型推断向后传播:类似于链式规则,其中信用分配是推导而不是估计。在 RLVR 验证最终结果的情况下,PLVR 的奖励是在程序结构上密集的每步合约判决。在 LiveCodeBench v6 和 Tau2Bench 上,采用 PLVR 的 30B 基本模型在匹配预算下比 RL 平均高出 27.8 个点,而前沿模型则高出一个数量级 13.6 个点。单个原始库服务于两个基准,因此新任务的边际成本是 100 个程序搜索示例,并且没有新的微调数据。在同等预算下,用在相同类型允许空间上的均匀采样代替损失引导搜索,使中值程序从 65.6 下降到 17.5,将后向传递而不是类型系统确定为优势的来源。我们发布了符号反向传播库和一致性检查器,因此该方法可以应用于除我们自己的库之外的原始库。