技术实践

Trillion Labs用GPU数据清洗构建韩语训练语料

AI 基础设施模型训练预训练数据基础设施

概述

Trillion Labs为韩语等低资源语言模型准备训练数据,原先CPU处理管线在大规模清洗中遇到扩展瓶颈。团队使用NeMo Curator的GPU语言识别、定制启发式过滤和去重流程,形成约1000亿Token的精选语料。来源报告韩语表现改善约5%,但没有给出足够信息把这个数值推广到所有评测任务;同时称相较CPU处理,同类数据任务的成本与能耗最多改善约十倍。这里比较的是特定数据处理环节,并非整个模型训练过程的成本或能耗。