技术实践

阿里ALake团队用Paimon Blob统一多模态数据入湖与AI推理回流

AI 基础设施数据基础设施

概述

阿里控股平台技术数据技术及产品部ALake团队针对多模态数据入湖的两难:二进制直接进列式文件会遇到内存溢出与字段频繁变更的格式难题;存对象存储加指针则产生大量小文件与额外IO。方案采用Paimon Blob机制:结构化字段存.parquet,二进制单独存.blob文件,条目带CRC32校验和,文件末尾的增量压缩索引支持随机访问;target-file-size建议4GB,写入时自动合并小文件。落地链路:OSS上的音视频图像经Spark UDF生成含URI、偏移量与长度的BlobDescriptor流式写入,日增PB级,CRC与OSS对齐;读侧经BlobDescriptor取流式输入,避免整文件载入内存。应用侧:AI引擎平台基于该表完成音频推理(VAD/SNR/DIA)并写回Paimon输出表;Ray经pypaimon(DLF2.5鉴权)做CRC64校验与视频元信息分析。披露结果:音频推理链路端到端耗时较OSS方案减少约10%。边界:blob功能有既有限制,一行仅支持一个blob字段、仅支持append表、不支持谓词下推与统计信息收集。