论文

把预测未来行为作为学习任务

Forecasting Future Behavior as a Learning Task

模型评测评测方法与指标

摘要

对人工智能系统的信任通常取决于对其工作原理的解释,然后用它来预测其对新输入的行为。对于大型推理模型(LRM),这种传统的路线特别难以遵循:单个标记生成的解释方法不能自然地推广到长轨迹,并且当被解读为自然语言时,轨迹本身通常不忠实。我们提出了一种绕过解释步骤的替代方案:将行为预测视为一项可学习的任务,并训练在单一推理轨迹上运行的行为预测器,以做出人们通常从解释中寻求的相同预测。预测器的训练数据是通过查询 LRM 获得的,无需人工注释,并且其推理是在单次前向传递中完成的。我们在两个任务上实例化这种方法:LRM 在重新运行时重复其答案的可能性有多大,以及删除部分输入如何改变其答案。我们在三个不同的推理数据集上对这两项任务评估了这种方法,发现经过训练的行为预测器比 GPT-5.4 和 Claude Opus-4.6 更准确,它们与天真的读者读取相同的轨迹,而推理成本只是其推理成本的一小部分。我们发现,端到端微调骨干网并从目标 LRM 初始化它对于获得强大的性能都是必要的。这些结果表明,推理轨迹携带的有关 LRM 未来行为的信息超出了天真的阅读所传达的信息。

把预测未来行为作为学习任务:论文配图
图 1:基于单一推理轨迹的行为预测。给定一个观察到的目标 LRM 轨迹(提示、推理、答案),训练有素的行为预测器会在一次前向传递中预测 LRM 未来行为的属性:LRM 重复答案的可能性有多大(重新运行一致性),或者每个提示部分导致答案的可能性有多大(反事实敏感性)。行为预测器在许多此类轨迹上进行训练,并通过查询 LRM 获得行为标签。前沿大语言模型天真地依赖于文本的忠实性来阅读相同的轨迹,无法扩展,因为它需要更多的计算,并且产生不太准确的预测。