大数跨境

亚马逊将数据库压缩任务从Apache Spark迁移至Ray,每年节省上亿美元

亚马逊将数据库压缩任务从Apache Spark迁移至Ray,每年节省上亿美元 雨神汇
2024-11-08
0
导读:IT现代化

点击蓝字关注我们


对雨生的文章感兴趣吗?

可以入群了解



标题:亚马逊将数据库压缩任务从Apache Spark迁移至Ray,预计每年节省上亿美元

亚马逊公司近日宣布,通过将数据库表压缩任务从Apache Spark迁移到基于Python的Apache Ray平台,其效率提升了82%,预计每年将节省约1亿美元的计算成本。这一消息是由亚马逊首席工程师Patrick Ames在2024年All Things Open大会上披露的。

主要内容:

1. 效率大幅提升:
- 使用Ray后,数据压缩效率提高82%。
- Spark处理1GB数据需约30秒,Ray仅需不到0.1秒。

2. 成本节约:
- 预计每年节省约250,000年的vCPU时间。
- 转化为AWS计算费用约1亿美元。

3. 迁移背景:
- 亚马逊从2016年开始从大型Oracle数据仓库转向自建可扩展的EB级数据湖仓。
- 初期使用Spark进行数据压缩,但随着数据量增长面临挑战。

4. Ray的优势:
- 提供Python友好的API。
- 适合处理大规模数据集。
- 可轻松将Python应用部署到大型集群。

5. 实施过程:
- 亚马逊重新设计压缩算法以适配Ray。
- 目前正并行运行Spark和Ray作业以确保一致性。
- 计划于今年全面迁移至Ray。

6. 挑战与改进:
- 初期Ray的可靠性为85%,低于Spark的99.91%。
- 经过优化,Ray的可靠性提升至99.15%。
- 内存利用率仍有提升空间,目前为55%。

7. 未来展望:
- 计划在2025年发布与Apache Iceberg兼容的压缩算法。
- Ray有潜力成为亚马逊所有数据管道的统一计算框架。

亚马逊的这一迁移案例展示了Ray在大规模数据操作中的潜力。Ames表示,Ray核心的灵活性使其能够为特定问题提供高度优化的解决方案。对于愿意投资的企业来说,Ray可能是解决棘手且昂贵问题的理想工具。

这一案例也反映了科技巨头在持续优化其内部系统,即使是小幅度的效率提升也能带来显著的成本节约。随着数据规模的不断增长,类似的技术迁移和优化可能会成为行业趋势。

(注:本新闻稿基于Joab Jackson的报道编写,如需引用请注明原始来源。)


雨生云计算

微信号:FinOpsCFM



【声明】内容源于网络
0
0
雨神汇
1234
内容 918
粉丝 0
雨神汇 1234
总阅读63
粉丝0
内容918