论文
学习指导体验式学习
Learning to Coach for Experiential Learning
摘要
语言模型可以从经验中学习,但原始解决方案轨迹通常太长且噪音太大,无法提供有效的指导。在这项工作中,我们提出了“教练学习”(L2C),这是一个框架,可以训练专门的大语言模型作为教练,从演员模型之前的轨迹中提取可操作的经验知识。演员保持冻结状态,而大语言模型作为教练则接受训练,以最大限度地提高演员指导反应的正确性所给予的奖励。我们研究了两种这样的奖励:同实例奖励,它改善了对原始问题的后续响应,以及跨实例奖励,它引发了转移到其他实例的知识。在数学推理和交互式文本游戏中,L2C 的表现始终优于自我完善和未经训练的大语言模型教练。运行体验式学习进行更多迭代可以进一步提高准确性,并且比增加参与者的解码预算更有效地使用额外的推理计算。经过训练的大语言模型作为教练也会转移到分配外的任务,并根据其指导的特定参与者调整其指导。