大数跨境

一套 Spark SQL,打通多种 Catalog:EMR Serverless Spark 统一数据处理实践

一套 Spark SQL,打通多种 Catalog:EMR Serverless Spark 统一数据处理实践 阿里云大数据AI平台
2026-08-28
1
导读:企业的数据往往分散在不同的系统中:数仓、数据湖、在线分析库各自独立,而业务计算又常常需要把它们放在一起。

企业的数据往往分散在不同的系统中:数仓、数据湖、在线分析库各自独立,而业务计算又常常需要把它们放在一起。过去,跨系统加工通常意味着多套连接配置、中间表搬运和一串相互依赖的任务。

阿里云 EMR Serverless Spark 的多 Catalog 能力改变了这个前提。通过在工作空间中接入多种 Catalog,一个 Spark Session 就能同时访问 DLF、Hive Metastore、MaxCompute、Hologres、StarRocks、Paimon、Iceberg 等数据空间,跨系统的读取、关联和写入收敛到同一条 Spark SQL 中完成。

本文从一个真实的跨 Catalog 加工场景出发,介绍 Serverless Spark 的 Catalog 支持范围,以及它如何简化数据链路和开发体验。

01

一个常见的跨 Catalog 加工场景

假设数据团队要生成一张用户经营日报。订单明细和会员等级分别保存在不同的数据空间,每张表都能独立查询,日报却需要把它们放在一起关联和计算。

实际的业务逻辑并不复杂:过滤当天订单,关联会员维度,再把结果写入新的明细表。麻烦通常出现在 SQL 运行之前——准备多套连接、搬运数据、创建中间表,再用多个任务把链路串起来。

EMR Serverless Spark 多 Catalog 将这些数据空间带进同一个 Spark Session。订单表、会员表和结果表可以直接出现在同一条 Spark SQL 中,开发者只需要继续完成日报的关联和写表逻辑。

随着 Catalog 支持面扩充,Spark Session 能够直接访问的数据会越来越多。表名仍然遵循同一种格式:

<catalog>.<database>.<table>

新增 Catalog 扩大了 Spark 的数据范围,已有的业务 SQL 可以继续沿用。

02

Serverless Spark 的 Catalog 支持全景

目前,DLF、Hive Metastore、Hologres、StarRocks 等 Catalog 已经可以直接在工作空间“数据目录”中添加。“数据目录”是工作空间统一展示和管理 Catalog 的入口,不影响 Catalog 本身的可用性。这个入口还会继续扩充。

Serverless Spark 同时支持 MaxCompute、Paimon、Iceberg 和自定义 Catalog。完整的支持范围包括:

  • DLF Catalog:访问 DLF 中注册的数据库和表,其中包括 Paimon、Iceberg 等表。

  • Hive Metastore Catalog:将已有 HMS 中的数据库和表纳入 Spark Session,保留原有元数据体系。

  • MaxCompute Catalog:通过内置 MaxCompute DataSource V2 访问 MaxCompute 项目中的表。

  • Hologres Catalog:通过三段式表名直接读写指定数据库中的表。

  • StarRocks Catalog:在 Spark SQL 中直接读写 StarRocks 库表。

  • Paimon Catalog:支持以 DLF、HMS 或 Filesystem 管理元数据,也可以在一个 Session 中访问多个 Paimon Catalog。

  • Iceberg Catalog:支持通过数据目录访问 DLF、HMS 中的 Iceberg 表,也支持独立 Iceberg Catalog。

  • 自定义 Catalog:基于 Spark CatalogPlugin 机制继续扩展,接入企业自己的元数据与数据系统。

03

接入一次,表即刻可用

在工作空间“数据目录”中选择 Catalog 类型、填写连接信息,即可完成添加。接入一次后,工作空间内的任务和会话都可以复用。业务代码引用稳定的逻辑表名,连接地址、网络和认证信息由平台集中管理。如果使用的 Catalog 类型还无法在数据目录中添加,也可以通过 spark.sql.catalog 配置自行注入访问。

常用数据源与 Paimon、Iceberg 等湖格式能力已经内置。开发者可以省去找包、打包、上传 JAR 和处理 ClassPath 冲突的过程,打开 Spark SQL 就开始写业务逻辑。

一个 Spark Session 可以同时看到这样的表:

dlf_prod.retail.ordershms_warehouse.ods.user_eventsodps.retail_dw.dwd_order_diholo_realtime.public.dim_user_levelsr_analytics.ads.product_reportpaimon_curated.ads.user_pay_detailiceberg_archive.history.closed_orders

这些表可以直接出现在同一条查询中。Catalog 名称标明数据来自哪里,后面的 Filter、Join、聚合、窗口和写表仍然使用标准 Spark 语法。

04

三个 Catalog,一条 SQL

把开头的用户经营日报写成 SQL:支付订单来自 MaxCompute Catalog,会员等级来自 Hologres Catalog,结果写入 Paimon Catalog。目标 Paimon 表已经创建,Spark 直接完成读取、关联和写入:

INSERT INTO paimon_curated.ads.user_pay_detailSELECT  '${bizdate}' AS dt,  o.order_id,  o.user_id,  COALESCE(u.member_level, 'NORMAL'AS member_level,  o.pay_amountFROM odps.retail_dw.dwd_order_di oLEFT JOIN holo_realtime.public.dim_user_level u  ON o.user_id = u.user_idWHERE o.ds = '${bizdate}'  AND o.order_status = 'PAID';

odpsholo_realtimepaimon_curated 三个 Catalog 共同组成一条 Spark SQL。中间没有同步表和搬运脚本,整条链路只提交一个 Spark 作业。

会员表迁移到 StarRocks、HMS 或 DLF 后,只需替换全限定表名,原有业务逻辑可以继续使用。目标表也可以切换到 DLF 管理的 Paimon 表或 Iceberg 表,读取、计算和写入仍然由 Spark 完成。

05

多 Catalog 进入同一份 Spark 执行计划

来自不同 Catalog 的表会进入同一个 Spark 逻辑计划。Spark 可以结合完整 SQL 安排数据扫描、条件下推、分区裁剪、Join 和 Shuffle,随后将结果直接写入目标 Catalog。

开发者无需把一段业务逻辑拆成多套客户端脚本,也不用靠临时表串联多个计算任务。代码、资源和运行状态都收敛在一个 Spark 作业中。

Serverless 平台按需拉起计算资源,Spark UI 展示完整执行过程,Driver 与 Executor 日志集中保留。跨 Catalog 作业与普通 Spark 作业拥有相同的开发、调优和排障方式。

06

写在最后

多 Catalog 让一个 Spark Session 可以访问更多数据空间。开发者沿用现有 SQL 和 DataFrame 代码,完成跨 Catalog 的读取、计算和写入。

随着“数据目录”持续扩充,更多 Catalog 会直接进入工作空间。用户面对的依然是熟悉的 Spark 作业、Spark UI 和运行日志。

/ END /


🎫 免费领票|2026云栖大会
9月22日-24日杭州见!三大重磅主论坛、140多场分论坛、超50000平米展区……
干货满满、精彩不容错过;门票数量有限,先到先得!

领票链接 >> https://yunqi.aliyun.com/2026/ticket?activityId=NjY3OQ==&ticketId=MTQz&channelId=NDczNA==

阿里云大数据 AI 平台邀您到场,共同参与 Agentic AI 时代 Data+AI 新篇章!

图片

点击「阅读原文」跳转链接,免费领票~

【声明】内容源于网络
0
0
阿里云大数据AI平台
阿里云大数据AI平台依托阿里领先的云基础设施、大数据和AI工程能力、场景算法技术和多年行业实践,一站式地为企业和开发者提供云原生的大数据和AI能力体系。帮助提升AI应用开发效率,促进AI在产业中规模化落地,激发业务价值。
内容 768
粉丝 0
阿里云大数据AI平台 阿里云大数据AI平台依托阿里领先的云基础设施、大数据和AI工程能力、场景算法技术和多年行业实践,一站式地为企业和开发者提供云原生的大数据和AI能力体系。帮助提升AI应用开发效率,促进AI在产业中规模化落地,激发业务价值。
总阅读12.4k
粉丝0
内容768