论文
改进从自然语言反馈中的交互式上下文学习
Improving Interactive In-Context Learning from Natural Language Feedback
摘要
根据纠正性反馈调整自身思维过程是人类学习的基本能力,在协作场景中尤其如此。相比之下,当前大语言模型训练范式严重依赖对海量静态语料的建模。尽管有助于知识获取,却忽视了模型动态适应上下文所必需的交互反馈回路。本工作提出一个框架,把这种交互式上下文学习能力视为一项独立、可训练的技能,而非涌现属性。我们提出可扩展方法,把单轮可验证任务转化为由信息不对称驱动的多轮教学式交互。我们首先表明当前旗舰模型难以在困难推理任务上整合纠正性反馈。随后证明,用该方法训练的模型从语言反馈中交互学习的能力大幅提升。更具体地,较小模型的多轮表现接近大一个数量级的模型。我们还观察到稳健的分布外泛化:数学问题上的交互训练可迁移到编程、解谜和迷宫导航等多样领域。定性分析表明这一提升源于上下文可塑性的增强。最后,我们表明该范式提供了通向自我改进的统一路径:通过训练模型预测教师的批评、有效建模反馈环境,我们把这一外部信号转化为内部能力,使模型即使没有教师也能自我纠正。
