点击蓝字关注我们
对雨生的文章感兴趣吗?
可以入群了解
![]()
标题:亚马逊将数据库压缩任务从Apache Spark迁移至Ray,预计每年节省上亿美元
亚马逊公司近日宣布,通过将数据库表压缩任务从Apache Spark迁移到基于Python的Apache Ray平台,其效率提升了82%,预计每年将节省约1亿美元的计算成本。这一消息是由亚马逊首席工程师Patrick Ames在2024年All Things Open大会上披露的。
主要内容:
1. 效率大幅提升:
- 使用Ray后,数据压缩效率提高82%。
- Spark处理1GB数据需约30秒,Ray仅需不到0.1秒。
2. 成本节约:
- 预计每年节省约250,000年的vCPU时间。
- 转化为AWS计算费用约1亿美元。
3. 迁移背景:
- 亚马逊从2016年开始从大型Oracle数据仓库转向自建可扩展的EB级数据湖仓。
- 初期使用Spark进行数据压缩,但随着数据量增长面临挑战。
4. Ray的优势:
- 提供Python友好的API。
- 适合处理大规模数据集。
- 可轻松将Python应用部署到大型集群。
5. 实施过程:
- 亚马逊重新设计压缩算法以适配Ray。
- 目前正并行运行Spark和Ray作业以确保一致性。
- 计划于今年全面迁移至Ray。
6. 挑战与改进:
- 初期Ray的可靠性为85%,低于Spark的99.91%。
- 经过优化,Ray的可靠性提升至99.15%。
- 内存利用率仍有提升空间,目前为55%。
7. 未来展望:
- 计划在2025年发布与Apache Iceberg兼容的压缩算法。
- Ray有潜力成为亚马逊所有数据管道的统一计算框架。
亚马逊的这一迁移案例展示了Ray在大规模数据操作中的潜力。Ames表示,Ray核心的灵活性使其能够为特定问题提供高度优化的解决方案。对于愿意投资的企业来说,Ray可能是解决棘手且昂贵问题的理想工具。
这一案例也反映了科技巨头在持续优化其内部系统,即使是小幅度的效率提升也能带来显著的成本节约。随着数据规模的不断增长,类似的技术迁移和优化可能会成为行业趋势。
(注:本新闻稿基于Joab Jackson的报道编写,如需引用请注明原始来源。)


