产品与服务
火山引擎 Ray / Daft 增强:Data Checkpoint、AutoScale、Flow Insight、Remote DataLoader 与 GPU 向量去重
基于多模态数据湖的新一代人工智能应用——Nvidia 工具链落地实践的深度洞察
概述
火山引擎在 Ray 与 Daft 上做了多项增强:Ray Data Checkpoint 为开源 Ray 不具备的能力,可记录并保存已计算数据与失败中断过程,任务恢复时跳过已处理数据从 checkpoint 继续,避免重复处理、节省 GPU/CPU 资源;Ray Data AutoScale 通过自适应改变 Actor 数目自动调整 Operator 并发度,无需手动调优;可观测性侧针对 Ray 原生 History Server 性能瓶颈做专项优化并上线 Flow Insight,内部测试中数千至上万任务并发下 UI 仍稳定;Remote DataLoader 通过部署外置 Ray 与 Daft 集群分隔 GPU 与 CPU 算力,使数据加载在 CPU 集群无限扩展、避免 GPU 训练空置,并支持对象存储与 PFS 并行文件系统快速加载、训练中断时用 Daft 保存当前 step 状态。Daft 侧以 Rust 为内核,原生支持多模态处理、GPU/CPU 异构调度、Python dataframe 与 SQL、Lazy Download 延迟图片解析降内存,火山引擎侧补齐算子、支持两种底层计算引擎与原生 shuffle 并打通 LAS Catalog。基于 GPU 的分布式向量去重相比传统 CPU 分布式架构整体处理效率提升 10 到 100 倍,支持亿级向量规模下的分钟级去重。