论文
在线模仿学习何时对 LLM 后训练 有帮助?超越地平线(非)可实现性的作用
When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon
摘要
在线模仿学习 (IL),特别是 同策略 蒸馏,已成为一种强大的 LLM 后训练 方法,通常优于离线监督 微调 (SFT)。然而,对于在线互动何时以及为何有所帮助的原则性理解仍不清楚。在这项工作中,我们挑战了错误积累是在线IL优势的主要来源的观点,并表明在线交互的好处关键取决于设置是否可实现,即学生政策类是否可以代表专家政策。在可实现性下,我们凭经验发现离线 IL 已经与专家性能相匹配。相比之下,在不可实现(错误指定)的设置中,我们证明即使在水平 $H=1$ 时,离线 IL 也会遇到信息论瓶颈,并提出相对于奖励的错误指定的结构特征,在该特征下,尽管专家和学生策略之间存在较大的分布不匹配,在线 IL 仍可实现高性能。