技术实践

字节跳动以TokaDB支撑推荐模型混合数据访问

AI 基础设施数据基础设施

概述

TokaDB 面向字节跳动内部 Trace、搜广推、财经、风控、电商、IM 消息等海量数据业务场景,进入大推荐模型(Large Recommendation Models,LRM)时代后需同时满足训练侧大范围扫描长行为序列与推理侧毫秒级读取最新特征与缓存结果,面临混合访问模式冲突、规模与成本压力、资源治理三大挑战。 三项设计:一、混合访问专用的数据组织,围绕真实访问模式重做数据布局,让系统既能高效点查单个用户的完整行为序列,也能按时间范围快速扫描所需数据段,尽量避免无效读取与重复拼接。二、成本-性能协同优化的 I/O 引擎,通过存储计算分离、冷热分层、在线纠删码(Erasure Coding)与「日志即数据(Log as Data)」,让 HDD 等低成本介质也能承接高强度业务压力,应对百 PB 到 EB 级数据规模。 三、基于优先级的资源管理器,围绕 CPU、缓存与 I/O 构建优先级治理,使在线推理、离线训练与后台任务并存时高优先级在线服务保持稳定。正文称在真实业务测试中,TokaDB 相比传统方案实现了更优的端到端性能并大幅降低整体硬件成本,部分典型场景成本下降达 50% 以上。