产品与服务

ApsaraMQ for Kafka × OSS Tables:Kafka Table Topic 以 Iceberg 格式零 ETL 入湖

AI 时代,实时入湖正在告别 ETL:从 Kafka 到 Iceberg 的架构减法

AI 基础设施数据基础设施

概述

把通用入湖能力前移到消息与表存储链路:分协议接入层(兼容标准 Kafka Producer/Consumer 协议)、转换处理层(RecordProcessor 做 Key/Value 反序列化、Flatten 与 Debezium 转换链、分区路由)、表存储层(Iceberg 表写入、元数据管理、对象存储落盘与后台优化)三层,记录转换、Schema 感知与演进、Iceberg 事务提交三个阶段端到端完成;Schema 变更中 ADD_FIELD、MAKE_OPTIONAL、PROMOTE_TYPE 及嵌套递归演进自动应用,删除字段等不兼容变更保守拒绝;小文件按 L1 内存 Buffer 合并、L2 32MB 微批、L3 64MB 目标文件、L4 后台 Compaction 四层治理;Upsert 模式用 DataFile + DeleteFile 支持 Insert/Update/Delete 的 CDC 语义(debezium_unwrap + iceberg-v2);支持字段、时间、Bucket、Truncate 等 7 类分区与多维组合;兼容 Iceberg REST Catalog 与 OSS Tables 兼容 Catalog,下游可由 Spark、Trino、Flink、DuckDB 消费;入湖进度内聚于 Kafka Leader 元数据并采用轻量 HA,提供嵌入式与独立式两种部署模式。