论文

改进从自然语言反馈中的交互式上下文学习

Improving Interactive In-Context Learning from Natural Language Feedback

模型训练监督微调与指令调优

摘要

根据纠正性反馈调整自身思维过程是人类学习的基本能力,在协作场景中尤其如此。相比之下,当前大语言模型训练范式严重依赖对海量静态语料的建模。尽管有助于知识获取,却忽视了模型动态适应上下文所必需的交互反馈回路。本工作提出一个框架,把这种交互式上下文学习能力视为一项独立、可训练的技能,而非涌现属性。我们提出可扩展方法,把单轮可验证任务转化为由信息不对称驱动的多轮教学式交互。我们首先表明当前旗舰模型难以在困难推理任务上整合纠正性反馈。随后证明,用该方法训练的模型从语言反馈中交互学习的能力大幅提升。更具体地,较小模型的多轮表现接近大一个数量级的模型。我们还观察到稳健的分布外泛化:数学问题上的交互训练可迁移到编程、解谜和迷宫导航等多样领域。定性分析表明这一提升源于上下文可塑性的增强。最后,我们表明该范式提供了通向自我改进的统一路径:通过训练模型预测教师的批评、有效建模反馈环境,我们把这一外部信号转化为内部能力,使模型即使没有教师也能自我纠正。

改进从自然语言反馈中的交互式上下文学习
图2:(上)经由信息不对称的教学式互动:我们将单轮问题转换为多轮教学式互动。教师模型以特权信息(例如真实答案)为条件,在不透露最终答案的情况下向学生模型提供自然语言反馈,引导其纠正错误。(中)训练时RL微调:我们用RL训练学生模型以有效吸收语言反馈。学生进行多轮迭代;若答案正确(通过自动验证检查),则给予奖励(R=+1)并结束互动;若答案错误,教师提供反馈;若互动达到最大轮数(T_max轮),则奖励为零。(下)推理时评估:我们在三种设置下评估训练后的模型:(1)从语言反馈中学习(与外部语言反馈源交互)、(2)通用多轮任务(逻辑谜题或游戏等域外任务),以及(3)上下文内自我改进(In-context Self-Improvement),即模型同时扮演学生和教师两种角色以进行自我纠正。