论文
DataClaw0:从原始流中代理定制多模式数据
DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams
摘要
原始的多模式流非常丰富,但有噪音、冗余,并且与任何特定的训练目标不一致。今天,将它们转变为监督意味着要么脆弱的启发式方法,要么反复查询专有的视觉语言模型,这是每个新样本都会重复出现的成本。我们询问这种转换是否可以学习一次并重复使用,并形式化意图条件数据裁剪:给定原始流和高级意图,模型必须返回模式对齐、基于证据的训练实例。在 4B、9B 和 27B 处训练 DataClaw0,我们发现五个异构域是否应该共享一个模型取决于容量。联合训练的模型在两个较小的尺度上比每个领域的专家更差,但在最大的尺度上更好,将交叉放置在 18B 参数附近。匹配数据比较中,联合模型在每个域中看到的数据与该域的专家完全相同,将逆转归因于跨域传输而不是数据量:它在域数据匮乏的地方获得了最大的收益,并在完全不进行训练的域上恢复了 59% 的域内性能。下游 后训练 在 GUI 导航、动作视频生成和时空 VQA 上重现了这种顺序,并且联合配置的部署成本也更低,为一个模型而不是五个模型提供服务。 Github:https://github.com/vancyland/DataClaw0