技术实践
火山引擎以Lance治理智驾与内容多模态数据
概述
火山引擎自 2024 年起围绕智驾、具身智能等多模态场景参与 Lance 社区共建,并在 2025 年推进产品化与商业化落地。场景一为智驾数据湖:客户原先用 KV 存储多模态数据,每行对应一帧、一帧几百列、大小约 20 MB,采用 Python pickle 序列化、Schema 隐含在代码里导致下游复用困难,实验与交付需不断复制数据,且缺少有效压缩带来高性能存储成本压力。 引入 Lance 后,摄像头、传感器、点云与标签数据被治理成一张大宽表,新增列、减少列或更换 embedding 算子可在表结构层直接表达,在点云与图片等数据上引入压缩后原始数据被压到约 30%,并帮助客户应对当年超过 10 倍的数据体量增长。场景二为内容平台的数据清洗、去重与打分实验:原本在不同过滤、去重、打分规则下不断生成新的 Parquet 中间文件,导致中间表难管理、重复列多、成本高、缺少清晰处理时间线。 改为围绕主表、分支与 Tag 迭代——原始表清洗后形成加工表,冻结后拉出不同分支分别增加打分列,验证效果后打 Tag 发布,真正增量只有新增打分列,历史数据得以复用。在 Agent 记忆方向,Openclaw Memory Plugin 的实践分两条路线:偏企业知识的结构化沉淀用 Tag 实现毫秒级备份、用 Branch 支持团队记忆并增强混合检索与中文分词。 偏个人文档与偏好沉淀则利用模型擅长编辑 Markdown 的特点对记忆做语义切分与整理,分享中提到后者带来记忆捕获增强 30%、记忆召回准确率提升 20%。