论文

在 大语言模型 中使用概率程序训练归纳推理

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

模型训练合成数据

摘要

用于推理的 后训练 大语言模型 (LLM) 通常侧重于演绎任务,例如数学和编码,其中正确性是可验证的。然而,许多现实世界的推理问题都是归纳性的:智能体必须从稀疏、模糊的观察中推断出不确定的信念。使用标准 微调 方法进行归纳推理存在一些挑战,包括管理大规模、高质量标记数据集以及处理本质上分布的目标方面的困难。在这项工作中,我们引入了一种称为基于程序的后验训练(PPT)的新颖方法来解决这些限制:我们使用 LLM 生成不同的开放世界场景作为概率程序,运行概率推理以生成对查询的分布目标响应,然后对这些概率软标签进行微调。使用这种方法,我们在 10,000 个以编程方式生成的场景上微调 LLM,并评估保留的主题、人工标记的判断和外部基准。总体而言,PPT 极大地提高了对归纳任务的估计准确性,增强了与人类判断的一致性,并转移到外部基准进行估计和校准。此外,原始校准的增益并未包含在事后温度缩放中,这表明与输出重新缩放相比,模型具有更深层的内在不确定性。总之,这些结果表明,概率程序介导的 微调 是 后训练 LLM 可靠地执行近似归纳推理的一种有前途的方法。