论文

小模型为大模型数据控制侦察瓶颈解决顺序

Small Models Scout Bottleneck Order for Large-Model Data Control

模型训练合成数据

摘要

小代理模型常被用于为更大规模训练确定数据配比。我们追问它们的训练轨迹是否揭示了另一种可迁移的结构:更大的模型应该以何种顺序解决技能瓶颈。我们形式化了首达(first-passage)技能训练,其中每个受监控技能都有一个目标下限,目标是最小化达到所有下限所需的token数量。我们引入LogFloor,一个将每轮训练导向当前瓶颈的闭环控制器,产生按阶段排序的解决轨迹。在Qwen2.5-1.5B上的五个bAbI技能切片上,LogFloor平均降低56.2%的token成本。在70M到12B的迁移中,对70M侦察路径进行三轮回放,使全部八个目标运行都达到每个下限,按配对均值节省30.9%,按合并训练token节省39.4%,按源成本核算节省37.6%。在MMLU-control上,冻结的侦察路径在全部八个12B运行中成功。将路径压缩为静态边际配比或反转其阶段顺序会消除大部分收益,而仅有瓶颈标签仍部分有用。这些结果将按阶段排序的瓶颈解决确定为面向受监控技能目标训练的一种可迁移课程结构。

小模型为大模型数据控制侦察瓶颈解决顺序:论文配图
图1:所提出的 LogFloor 控制器在 K=5 个受监控技能下的简化可视化。每一轮 r 的瓶颈技能以橙色标出。在每一轮,LogFloor 将下一轮分配 w_r 的最大份额转移给该瓶颈,由此产生的有序序列 {w_r} 构成了瓶颈化解轨迹,我们随后会在更大的目标模型上重放该轨迹。