论文
递归语言模型泛化域外
Recursive Language Models Generalize Out of Domain
摘要
我们研究限制语言模型可以看到的内容可以改善学习。我们将标准 CoT(读取完整轨迹的更通用的学习器)与递归语言模型进行比较,后者通过在隔离的上下文中解决每个子任务来限制自身。在分布中,这种通用性是免费的:CoT 可以有效地模拟递归规则,因此 IID 通用性保证仅按常数因子变化,而递归并不能提供太多。但在域外,CoT 可以通过依赖当前子任务之外的上下文来适应训练,即一旦这些标记发生变化就会中断的快捷方式;递归上下文隔离排除了这种故障模式。尽管 CoT 的课程仍然涵盖了递归规则,但简单性偏见选择了捷径而不是事实。因此,要超越分布准确性和真正的推理,仅仅覆盖正确的规则是不够的;这与经典学习理论形成对比。