关键要点
- AWS投资1.1亿美元,支持高校研究人员使用专为AI设计的芯片。
- AWS Trainium正加速加州大学伯克利分校、麻省理工学院、卡内基梅隆大学等机构的AI研究。
- 所有研究成果均开源,改进将回馈更广泛的开发者社区。
编写能够充分释放性能的代码:专为AI设计的芯片
这是AI基础设施中最持久的挑战之一,影响着医疗、计算机科学及AI触及的所有领域。许多开发者仅拥有GPU使用经验,限制了其针对AI工作负载定制应用程序的能力。
这是AI基础设施中最持久的挑战之一,影响着医疗、计算机科学及AI触及的所有领域。许多开发者仅拥有GPU使用经验,限制了其针对AI工作负载定制应用程序的能力。
自启动以来,该项目已吸引超10,000名学生参与数十项研究提案,致力于应对机器学习、计算机科学、医疗保健和量子计算领域的重大挑战。
AWS Trainium2芯片
加州大学伯克利分校团队构建优化内核,应对复杂机器学习挑战
两个加州大学伯克利分校团队处于“Build on Trainium”早期工作的核心。两者均致力于解决同一核心挑战——构建决定芯片执行AI工作负载效率的优化内核(低级计算例程),但切入点不同。
Christopher Fletcher教授团队开发了TeAAL编程框架,允许开发者描述计算内容而非指定硬件执行方式。TeAAL负责转换并自动生成针对Trainium优化的低级代码。
测试显示,应用于LoRA(广泛用于微调大型AI模型的技术)时,该方法比标准方法快1.4至1.6倍。该框架已获IEEE Micro认可。
座谈会嘉宾包括加州大学伯克利分校教授(Christopher Fletcher、Sophia Shao、Alvin Cheung)及博士生,随后学生展示了通过Neuron Kernel Interface (NKI)实现Trainium开放架构的研究成果。
Sophia Shao教授和Alvin Cheung教授采取了不同方法。其系统Autocomp利用大语言模型自动生成和优化在Trainium上运行的低级代码,即用AI挖掘AI硬件潜力。与TeAAL辅助开发者自行编写代码不同,Autocomp自动化了整个流程,利用真实硬件性能反馈迭代代码,无需手动调优。
Autocomp下一阶段将从单个操作扩展至为Llama和Qwen等模型提供完整端到端流水线,运行于Trainium最强配置上。
其他美国高校如何使用Trainium
在卡内基梅隆大学、麻省理工学院、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校等机构,研究人员正利用Trainium加速各领域的发现。
伊利诺伊大学厄巴纳-香槟分校助理教授Minjia Zhang表示:“‘Build on Trainium’项目让实验室获得了数千个下一代AI芯片的访问权,使我们能解决以前无法触及的研究问题,同时让学生亲身体验支撑当今最大AI模型的基础设施。我们专注于使AI训练更快、更高效,并期待与更广泛的研究社区分享学习成果。”
在卡内基梅隆大学,Catalyst研究小组正在优化FlashAttention算法,通过减少数据在芯片内存部分间的移动频率,显著加快AI训练和性能。
Trainium加速从医疗保健到量子计算等领域的研究
在麻省理工学院,研究人员Brian Anthony正利用Trainium训练用于三维超声图像分析的AI模型。在该领域,更快的模型训练可直接转化为更好的患者护理水平。与传统GPU相比,其团队使用Trainium训练时吞吐量提高50%,总训练时间从数月缩短至数周。
而在加州大学洛杉矶分校(UCLA),Jens Palsberg教授将该程序用于模拟量子电路,这是量子计算研究与教育的核心挑战。
Palsberg表示:“该项目汇聚了一支优秀的学生团队,协作构建了高性能模拟器,使以前无法实现的大规模深度实验和动手学习成为可能。”
安努尔纳实验室工程师在得克萨斯州奥斯汀设计和测试定制硅硬件。
开源对推动所有AI开发者的研究至关重要
这项工作的关键推动因素是Neuron Kernel Interface(NKI),它让研究人员能以底层方式访问Trainium架构。这种级别的可见性在学术环境中极为罕见,使学生能构建超越标准软件库性能的解决方案,释放AI芯片更多潜力。
该项目在加速研究的同时形成了富有成效的反馈循环。团队开发的工具、优化技术和方法使Trainium对每位在其上构建应用的开发者更加强大且易用。所有团队均计划将其工作作为开源软件发布,并在顶级研究会议上发表成果,这意味着其益处远超任何单个实验室或机构。
通过投资下一代AI研究者,亚马逊不仅在打造更先进的芯片,也在为后续所有开发者降低门槛,助力其在医疗保健、AI智能体、机器人等领域取得下一次重大突破。
了解更多关于“基于Trainium构建”及亚马逊的AI创新。

