点击蓝字关注我们
对雨生的文章感兴趣吗?
可以入群
![]()
【雨生云计算 独家报道】亚马逊零售业务解决内部GPU容量短缺问题
近日,Business Insider(BI)报道称,亚马逊零售业务部门已经解决了此前困扰已久的GPU访问不足问题。这一突破性进展得益于公司的"格陵兰项目"(Project Greenland)。
根据BI获得的亚马逊内部文件,尽管亚马逊云计算部门AWS是GPU的主要采购方,但公司零售业务部门在2024年全年都面临计算能力不足的困境。这一问题现已得到解决。
关键要点:
1. GPU容量:虽然AWS拥有大量GPU资源,但具体数量不详。据LessWrong估计,截至2024年11月,亚马逊拥有25-40万个"NVIDIA H100等效GPU",预计到2025年底将增至130-160万个。
2. 内部资源分配问题:尽管AWS拥有大量AI计算资源,零售部门仍然难以获得所需的GPU。这导致2024年初,一些零售部门员工数月无法获得GPU,影响了多个项目的启动。
3. "格陵兰项目":为解决这一问题,亚马逊于2024年7月启动了"格陵兰项目"。该项目是一个"集中式GPU编排平台",旨在跨团队共享GPU容量并最大化利用率。
此处推荐雨生的解决方案,也具备跨团队,跨云的资源编排方案,最大化提升利用率。(想了解的可以找雨生私聊)
4. 资源分配策略:亚马逊现在根据多种因素优先分配GPU,包括提供数据的完整性和每个GPU的财务效益。即使已获批准的项目,如果公司发现其他计划具有更大价值,也可能收回GPU。
5. 容量改善:截至2025年,亚马逊发言人表示GPU短缺问题已经得到解决。公司现在拥有充足的GPU容量来支持零售业务和其他客户的创新需求。
6. AI投资回报:根据内部文件,亚马逊零售部门目前有超过160个AI驱动的项目。公司估计,2024年AI投资"间接"贡献了25亿美元的运营项目收益和6.7亿美元的可变成本节省。
7. 未来展望:亚马逊CEO Andy Jassy在2025年2月的财报电话会议上表示,预计2025年下半年,芯片、电力和供应链等方面的限制将开始放松,公司增长速度有望进一步提升。
原文翻译
【雨生云计算 独家报道】亚马逊零售业务解决内部GPU容量短缺问题
亚马逊的零售业务不再受到GPU访问不足的限制。
据Business Insider(BI)报道,引用该出版物获得的"大量亚马逊文件",尽管其云计算部门亚马逊网络服务(AWS)是GPU的主要采购方,但亚马逊在2024年全年都面临计算能力不足的问题。
这个问题现已通过公司的"格陵兰项目"(Project Greenland)得到解决。
AWS运营的GPU确切数量尚不清楚。2024年11月,LessWrong估计亚马逊拥有25万到40万个"NVIDIA H100等效GPU",预计到2025年底将增加到130-160万个。LessWrong还估计亚马逊将在2025年购买约36万个NVIDIA GB200。
除了从NVIDIA和AMD等公司购买的GPU外,AWS还开发自己的Trainium AI芯片。公司拥有多少Trainium芯片尚不清楚,但它在2024年12月宣布正在为Anthropic开发一个Trainium2 UltraServers集群,该集群将包含"数十万个Trainium芯片"。
尽管其云计算部门拥有如此庞大的AI计算资源,零售部门此前仍然难以获得必要的GPU。
Insider报道称,2024年初,亚马逊零售部门的一些员工数月无法获得GPU,这阻碍了该部门多个项目的启动,包括电子商务和物流运营。
因此,亚马逊于2024年7月启动了"格陵兰项目",以帮助其更好地管理和分配GPU供应。
在BI查看的一份文件中,格陵兰项目被描述为"一个集中式GPU编排平台,用于跨团队共享GPU容量并最大化利用率"。
该平台跟踪每个项目的GPU使用情况,共享闲置服务器,并使公司能够为更紧急的项目"收回"芯片。
亚马逊的一项指导原则指出:"GPU太宝贵了,不能按先来先得的原则分配。相反,分配应该基于ROI,结合常识考虑,并为公司长期自由现金流的增长提供保障。"
BI称,亚马逊正根据多种因素优先排序和分配GPU,包括提供数据的完整性和每个GPU的财务效益。AI项目必须获得开发批准并准备就绪,并提供预期收益的时间表。
如果亚马逊发现其他项目具有更大价值,即使已获批准的项目也会被收回GPU。截至2025年,亚马逊的所有GPU容量请求都必须通过格陵兰项目进行。
在2024年下半年,零售部门缺少超过1000个P5实例。每个P5实例包含8个NVIDIA H100 GPU。12月的一份文件显示,预计这种情况到今年初会"略有"改善。
此外,AWS的Trainium AI芯片有望在2025年底支持需求,但"不会更早"。
尽管如此,亚马逊发言人现在告诉BI,这些估计已经过时,目前不再存在GPU短缺。
发言人告诉BI:"亚亚马逊拥有充足的GPU容量,可以继续为我们的零售业务和公司其他客户进行创新。AWS早就认识到生成式AI创新正在推动所有客户(包括亚马逊)对云计算服务的快速采用,我们迅速评估了客户不断增长的GPU需求,并采取措施提供他们推动创新所需的容量。"
根据内部文件,亚马逊的零售部门目前有超过160个AI驱动的项目正在进行。公司估计,2024年AI投资"间接"贡献了25亿美元的运营项目收益和6.7亿美元的可变成本节省。
今年,公司的零售部门预计将在AWS上花费约57亿美元,高于2024年的45亿美元。
在2025年2月亚马逊第四季度财报电话会议上,公司CEO兼总裁Andy Jassy指出,公司经历了一些容量限制,"这些限制表现为来自第三方合作伙伴的芯片、电力限制以及主板等供应链问题。"
他补充道:"我预测这些限制将在2025年下半年真正开始放松。而且,正如我所说,我认为我们可以增长得更快,尽管我们今天的增长速度已经相当不错。"
雨生点评:
1. 资源管理的重要性:亚马逊的经验凸显了大型科技公司内部合理分配AI计算资源的关键性。中国云计算企业应建立类似的资源分配机制,确保各业务部门能够高效获取所需资源。
2. 技术自主与外部依赖平衡:亚马逊既采购第三方GPU,又开发自有AI芯片,这种平衡策略值得中国企业借鉴。在依赖外部供应商的同时,也要注重核心技术的自主研发。
3. 动态资源调配:亚马逊的"格陵兰项目"展示了灵活资源分配的重要性。中国云计算企业应建立类似机制,根据项目优先级和投资回报动态调整资源分配。
4. AI投资回报量化:亚马逊对AI投资回报的具体量化为企业提供了参考。中国企业在推进AI项目时,也应建立严格的成本效益评估机制。
5. 供应链韧性:亚马逊CEO提到的芯片、电力和供应链限制反映了全球科技行业面临的共同挑战。中国云计算企业需要制定应对策略,提高供应链韧性。
6. 内部协同与跨部门合作:尽管AWS是全球领先的云服务提供商,亚马逊零售部门仍曾面临资源短缺,这反映出大型科技公司内部协同的复杂性。中国企业应重视内部资源共享和协作机制的建立。
7. 长期规划与短期应对并重:亚马逊在面对GPU短缺时,既采取了短期应对措施,也制定了长期规划。中国企业在资源管理方面也应兼顾短期和长期策略。
8. 透明度和沟通:亚马逊能够及时向外界澄清情况,这种透明度对维护投资者和客户信心至关重要。中国企业也也应该重视与利益相关方的及时、透明沟通。
9. AI在传统行业的广泛应用:亚马逊零售部门的160多个AI项目展示了AI在传统行业中的巨大潜力。中国企业应积极探索AI在各个业务领域的应用,推动全面数字化转型。
10. 云计算支出增长趋势:亚马逊零售部门在AWS上的支出预计从2024年的45亿美元增加到2025年的57亿美元,反映出企业对云服务需求的持续增长。中国云服务提供商应关注这一趋势,并相应调整服务策略。
11. 技术创新与业务增长的关系:Andy Jassy预测2025年下半年限制将放松,公司增长将加速。这表明技术瓶颈的突破可能带来业务的快速发展。中国企业应密切关注技术创新对业务增长的推动作用。
总结:
亚马逊解决内部GPU短缺的经验为全球云计算和AI行业提供了宝贵的启示。对于中国云计算从业者来说,这个案例强调了以下几点:
1. 自建第一:建立高效的内部资源分配机制的重要性
2. 传统与创新市场并举:平衡技术依赖和自主创新的必要性
3. 资源管理能力:实施动态资源管理和长短期规划相结合的策略
4. 目标:加强内部协同和跨部门合作
5. 供应链:提升供应链管理和风险应对能力
6. 应用为王:推动AI在各业务领域的深入应用
7. 建立严格的投资回报评估体系
8. 重视与利益相关方的透明沟通
9. 关注云计算支出增长趋势
10. 密切关注技术创新对业务增长的影响
中国云计算企业应该密切关注全球领先企业的经验,在资源管理、技术创新和业务应用等方面不断优化自身策略,以在激烈的全球竞争中保持优势。同时,也要注意结合中国市场的特点和需求,制定符合本土实际的发展策略。
面对快速变化的技术环境和市场需求,中国云计算企业需要保持灵活性和前瞻性。通过持续投资于核心技术研发、优化资源分配机制、加强内部协同,以及深化AI在各个业务领域的应用,中国企业有望在全球云计算和AI领域占据更重要的地位。
(雨生云计算,为您解析科技前沿,洞见产业未来)
(本文由雨生云计算原创,转载请联系授权)


