技术实践

火山引擎支持模型客户用Lance管理海量文件

AI 基础设施上下文与知识知识获取与更新数据基础设施分布式训练基础设施

概述

客户原用 WebDataset 存储预训练数据,检索图片或文本时需先按索引找到对应 tar 文件、解压后再查找,架构不优雅且引发严重读放大;图文混排处理中的大规模数据 Shuffle 超出开源 Spark 承载能力,导致文本去重等任务频繁失败。火山引擎给出的方案是把 WebDataset 迁移至 Lance 格式,将元数据作为列标签存储、图片以二进制形式保存,借助 Lance 的列裁剪与随机点查能力实现秒级对数十亿文件的高效点查、显著降低读放大;Shuffle 过程仅需从少量字段提取 Row ID,大幅减少 I/O 开销与内存压力。