技术实践

bp用 Apache Spark Declarative Pipelines 全球标准化数据工程

应用与实践结构化分析、预测与决策

概述

背景与问题:bp各团队的数据管道此前各自为政,有的跑在AWS Glue、有的用Azure原生工具,Spark版本、依赖、编排与运维保障都要自行管理,bp认为「难的不是写模式,而是长期维护」。方案与落地:bp将Spark Declarative Pipelines(SDP)确立为默认转换框架,统一运行在Databricks Lakeflow上:编排、增量处理、流式可靠性与依赖管理交给平台,批与流「拨个开关」即可复用同一条管线;平台元数据驱动,成本可扫描系统表按成本模型核算,声明式约束防止团队「越界」;编排也统一到Lakeflow,形成摄取—转换—调度一体化运营模型,并叠加Genie支持即席分析。效果与数据:据介绍,转换工作负载几乎全部标准化于SDP,覆盖超7000条转换管线,含摄取层合计超11000条;通过共享库与可复用模式,一条航空相关工作负载的管线数量减少24%;运营数据整合后以Genie取代60多页、150多个图表的报告,预上线测试中一项此前需运营负责人5小时以上的任务缩短到约20分钟,提升18倍。案例为Databricks官网客户故事自述口径,未见独立核验。