论文
对测试时语言模型的延迟监督
Delayed Supervision for Test-Time Language Models
摘要
测试时语言模型在处理输入序列时采用紧凑的内存。这一视角涵盖了 LaCT 中的非线性快速权重学习、DeltaNet 中的关联增量规则更新以及 RWKV-7 中的广义增量规则状态更新。训练这些模型来预测下一个标记并不明确要求事实在许多后续内存更新后仍然可访问。我们研究了这种测试时记忆的延迟监督:在训练后,仅在长时间的不相关事件发生后才提出基于模拟器的问题,并与普通的下一个标记预测一起监督其答案。问题是在一次性分支上评估的,因此它们的答案永远不会进入持续的事件流。该结构将保留与修订区分开来:保留的事实必须在整个延迟期间保持有效,而修订的事实必须以其最新值来回答。我们使用 TextWorld 训练轨迹以及共享的 BABILong 和 RULER 评估面板在 LaCT-760M 和普通 DeltaNet-1.3B 上评估这种方法,并包括单独报告的 RWKV-7 比较。相对于仅事件训练,延迟 QA 使 LaCT 的 BABILong 提高了 5.48 个百分点,DeltaNet 的 BABILong 提高了 1.32 个百分点,单针 RULER 分别提高了 1.45 个百分点和 3.27 个百分点。 RWKV-7 的比较报告显示其自己的面板分别获得了 4.60 和 7.00 点的增益。这些结果支持延迟语义监督作为可用测试时记忆的实用外部训练目标,同时保留了有多少好处具体来自延迟而不是一般的问答和答案终止监督。