论文

代理更新何时可以改善决策?轨迹明智转移的局部理论

When Do Surrogate Updates Improve Decisions? A Local Theory of Trajectory-Wise Transfer

模型评测模型行为与机制分析

摘要

许多模型都面临着不匹配的问题,它们通过轨迹损失进行更新,但通过下游任务奖励进行评估。这里,轨迹是一个训练实例,它会引起代理损失,其减少可能不会跟踪模型的决策效用更新。从理论上讲,我们询问轨迹训练的一步何时可以减少群体替代损失和决策风险,以及转移如何随着重复更新而累积。为了形式化这一点,我们首先修复一个检查点和一个受限的更新空间,并将轨迹引起的群体替代风险和决策风险的减少分别定义为其可学习性和决策效用。在此基础上,我们的理论产生了四个主要结果。首先,一步转移界限将它们的差异分解为非负校准后的一阶梯度失准和二阶曲率;路径扩展会在重复更新中累积相同的项。其次,当可访问代理梯度非零时,当可访问代理和决策梯度正共线时,每个可访问方向上的通用一阶传递准确地成立。第三,校准差距限制了基于可学习性的轨迹选择的决策遗憾,而候选差异细化通过仅保留影响成对排名的方向来加强这种保证。最后,我们在嵌套更新空间之间建立近似校准权衡。受控 gridworld 和 LLM 后训练 实验产生的结果与我们的预测一致。