论文
LLM-as-a-Coach:不可验证任务的体验式学习
LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
摘要
开放式任务的强化学习 (RL) 将 LLM 基于标题的评估压缩为标量奖励,丢弃丰富的文本反馈并将响应与不同的质量配置文件合并在一起。我们提出体验式学习(EL),它将反馈模型从 LLM-as-a-Judge 重新调整为 LLM-as-a-Coach。教练将其对每个 同策略 响应的评估提炼为可转移的经验知识,这些知识以教师模型为条件,并通过 同策略 上下文 蒸馏 被政策内化。与标量奖励相比,这种更高带宽的反馈通道提供了密集的监督,并保留了高质量响应中的细粒度偏好。在两个策略系列中,借助策略本身或专有模型的反馈,EL 在保留和未见的开放式任务上始终优于基于规则的强化学习。值得注意的是,EL 可以更好地推广到训练分布之外,并减轻 奖励作弊 的影响。这些发现将经验知识确立为 后训练 在不可验证任务上更丰富、更通用的学习信号。