论文

自动学习:惊喜中学习,证明中承诺

Autolearn: Learn by Surprise, Commit by Proof

模型训练合成数据

摘要

我们提出了 Autolearn,这是一个框架,使语言模型能够在没有外部监督的情况下从它们阅读的文档中学习。产生异常高的每个词元损失的段落会被标记,通过自生成的问答链进行验证,并通过信念比例的 $β_2$ 调整进行训练。我们引入扰动间隙(释义与原始困惑度之比)作为区分记忆与理解的指标。关键机制是训练数据格式:问答格式训练将扰动间隙驱动到预训练基线以下(2.098 vs. 2.204,$Δ= -0.106$,$> 10σ$),抑制标记序列记忆,而标准 微调 的最佳尝试仍然在噪声范围内($Δ= -0.010$,$< 1σ$)。在 Qwen3 和 Phi-4 系列的四个模型中,Autolearn 是唯一进入此状态的方法。随机评估揭示了特定于段落的知识获取:训练后生成正确新颖事实的概率从 6% 上升到 54% ($p < 10^{-4}$),并且问答格式在真正新颖的事实上优于标准 微调。该系统是自我熄灭的:学习的内容将惊讶程度降低到阈值以下,并在重新遇到时跳过。