论文

走向具有未知奖励的推理时间对齐理论

Towards a theory of inference-time alignment with unknown rewards

模型推理推理验证与自校正

摘要

生成模型对齐受到了广泛的关注,并且在监督 微调 和推理时间计算方面取得了重大进展。然而,从统计学习的角度来看,对齐仍然知之甚少。我们将推理时间对齐表述为弱到强的学习问题,其中假设参考策略(弱模型)相当好,目标是生成一个强模型,以任意高的概率在测试时预测良好的响应。我们的问题被表述为从头开始学习——一切都是从数据中学习的,而不是假设可以获得良好的奖励估计,因此与现有的推理时间对齐理论不同。我们的框架与 Joshi 等人最近的工作相似(arXiv:2510.15464),其中对于每个提示,都可能有多个良好的响应。我们对对齐可学习性的定义遵循标准 PAC 学习原则。我们引入了奖励类的一种新颖的组合维度,我们称之为对齐维度,并表明它完全表征了对齐的可学习性——当且仅当其对齐维度是有限的时,奖励类才是可学习的对齐。我们学习过程的核心是学习成对比较器,然后对候选响应进行锦标赛。我们相信,我们的结果可能有助于建立对对齐的完整理论理解。