大数跨境

EMR Serverless Spark多模态 Daft 算子市场免费公测 | 10分钟极速实战(附视频教程)

EMR Serverless Spark多模态 Daft 算子市场免费公测 | 10分钟极速实战(附视频教程) 阿里云大数据AI平台
2026-09-03
0
导读:多模态数据处理,从写第一行代码开始。Daft 算子市场公测来了!
多模态数据处理,从写第一行代码开始。

Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。

以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量"噪音"。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈

本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。

01
🚀 10 分钟完成 demo,超简单
场景介绍

该 Demo 面向多模态数据处理场景,将对第一视角视频进行分布式抽帧与去黑边处理,并调用 Qwen3.7 多模态大模型精准识别每帧的手部交互动作,并在 Notebook 中直观呈现图文对应的动作分析结果。

EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践

https://developer.aliyun.com/article/1747724

视频讲解
前提条件

1. 阿里云账号,开通创建 EMR Serverless Spark Workspace 和 OSS Bucket

2. 已开通 EMR Serverless Spark AI 中心。请进入 Serverless Spark 的工作空间 - AI 中心,点击"开通 AI 中心"

开通 AI 中心

3. Spark 工作空间按量配额上限 > 20 CU

按量配额上限设置 1
按量配额上限设置 2
按量配额上限设置 2

4. Spark 工作空间队列弹性并发上限 > 20 CU

队列弹性并发上限设置
操作步骤

👉参考原文下载本 demo 中涉及的文件:https://help.aliyun.com/zh/emr/emr-serverless-spark/getting-started/multimodal-data-processing-quick-start

Step 1 · 下载 daft_demo.ipynb 文件,并导入您的 Spark workspace 中
导入 notebook 到 Spark workspace
Step 2 · 下载要处理的视频到本地,并上传到您的 OSS Bucket
注意:请确保您的 spark workspace 与 OSS Bucket 属于同一个 region
Step 3 · 替换 daft_demo.ipynb 代码中的路径变量
yaml
1# 抽帧之后的图片会放到该目录,<请替换为您的 oss 输入视频,以及输出目录>
2INPUT_VIDEO = "oss://apsara-demo/dataset/P01_101_part012_299.40s_310.00s.mp4"
3OUTPUT_DIR = "oss://apsara-demo/dataset/daft-output/"
Step 4 · 在 Spark Workspace 中,创建 Notebook Session,并运行 daft_demo notebook
创建 Notebook Session
注:选择 esr 版本为 esr-4.9.0 (Spark 3.5.2, Scala 2.12, Ray 2.55.1, Daft 0.7.17)

运行效果图:

运行效果图
02
算子市场免费公测窗口

2026 年 8 月 31 日 — 9 月 30 日

公测期间算子调用 Qwen3.7-flash 模型 免费,无其他额外 token 费用!

⚠️ 公测须知

公测期间 SparkSQL AI Function、Daft Local、Daft on Ray 运行环境中的算子及 Qwen3.7 模型调用均免费。公测结束后按实际使用量计费,具体标准会在结束前公布,不用担心突然扣费。

公测期间不保障 SLA,但服务不降级,放心用就好。请遵守阿里云数据安全规范,不要上传敏感数据哦。

🔥 立即参与

👉 登录 EMR Serverless Spark 控制台:,进入 Spark Workspace,开始你的第一个算子任务吧!

EMR Serverless Spark 控制台:https://emr-next.console.aliyun.com

参考文档

EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践:https://developer.aliyun.com/article/1747724

如体验过程中有任何问题,欢迎加入 EMR Serverless Spark 钉群进行交流!

/ END /


🎫 免费领票|2026云栖大会
9月22日-24日杭州见!三大重磅主论坛、140多场分论坛、超50000平米展区……
干货满满、精彩不容错过;门票数量有限,先到先得!

领票链接 >> https://yunqi.aliyun.com/2026/ticket?activityId=NjY3OQ==&ticketId=MTQz&channelId=NDczNA==

阿里云大数据 AI 平台邀您到场,共同参与 Agentic AI 时代 Data+AI 新篇章!

点击「阅读原文」跳转链接,免费领票~

【声明】内容源于网络
0
0
阿里云大数据AI平台
阿里云大数据AI平台依托阿里领先的云基础设施、大数据和AI工程能力、场景算法技术和多年行业实践,一站式地为企业和开发者提供云原生的大数据和AI能力体系。帮助提升AI应用开发效率,促进AI在产业中规模化落地,激发业务价值。
内容 768
粉丝 0
阿里云大数据AI平台 阿里云大数据AI平台依托阿里领先的云基础设施、大数据和AI工程能力、场景算法技术和多年行业实践,一站式地为企业和开发者提供云原生的大数据和AI能力体系。帮助提升AI应用开发效率,促进AI在产业中规模化落地,激发业务价值。
总阅读12.4k
粉丝0
内容768