论文
反思性上下文学习:研究上下文空间的优化原语
Reflective Context Learning: Studying the Optimization Primitives of Context Space
摘要
一般能力的智能体必须以跨任务和环境的方式从经验中学习。无论学习对象位于参数空间还是上下文空间,学习的基本问题(包括学分分配、过度拟合、遗忘、局部最优和高方差学习信号)仍然存在。虽然这些挑战在经典机器学习优化中得到了很好的理解,但它们在上下文空间中仍未得到充分探索,导致当前的方法支离破碎且临时性。我们提出了反思性情境学习(RCL),这是一个统一的代理框架,可以通过重复交互、对行为和故障模式的反思以及对情境的迭代更新来学习。在 RCL 中,反射将轨迹和当前上下文转换为类似于梯度的定向更新信号,而变异则应用该信号来改善上下文空间中的未来行为。我们将最近的上下文优化方法重新定义为这个共享学习问题的实例,并用经典的优化原语系统地扩展它们,包括批处理、改进的奖励归因信号、辅助损失、失败重放和用于减少方差的分组轨迹采样。在 AppWorld、BrowseComp+ 和 RewardBench2 上,这些原语在强基线上进行了改进,其相对重要性随着任务体系的不同而变化。我们进一步分析初始化的鲁棒性、批量大小、采样和课程策略、优化器状态变量的影响,以及将更强或更弱的模型分配给不同优化组件的影响。我们的结果表明,通过上下文更新进行学习不应被视为一组孤立的算法,而应被视为一个优化问题,其机制可以通过可转移原则进行系统研究和改进。