“这是目前中国算力性能最强的AI芯片,性能达到M890的3倍。”在9月22日的云栖大会上,阿里巴巴集团CEO吴泳铭如此介绍新一代真武V900。
这款最强AI芯片的亮相,将平头哥的算力“硬实力”推向聚光灯下。但对于考虑换用真武的客户而言,还需确认另一件事:过去写下的代码、积累的工具和开发经验,能否平滑迁移?芯片之外,软件生态的“软实力”同样决定客户的选择。
9月23日,平头哥公布了AI软件栈T-Head SAIL的最新开源进展,进一步扩大框架适配、加速库、工具链和通信库等领域的开放范围。
在平头哥的比喻中,AI芯片是发动机,软件栈则是“变速箱+传动系统+驾驶系统”。发动机性能再强,最终发挥多少取决于软件能否让模型顺利迁移、运行与优化。如今,这套配套软件正进一步向开发者开放。
据悉,真武AI芯片已服务20多个行业的650多家客户,蚂蚁、小红书、小鹏汽车等头部企业已开始使用T-Head SAIL。
其中,小红书基于T-Head SAIL开源代码,开发了模型迁移与算子优化Agent,加速生成式推荐模型在真武上的部署。平头哥提供基础软件能力,客户将业务经验写入工具,继续迁移与优化,芯片背后的生态软实力在此过程中不断积累。以阿里为代表的大厂造芯,正从交付芯片走向更广泛的开放共建阶段。
这次,平头哥具体开放了什么?
简而言之,T-Head SAIL是阿里平头哥围绕真武AI芯片打造的类“CUDA”软件栈。它连接PyTorch等上层AI框架和底层真武硬件,负责模型迁移、编译执行、计算加速和开发调试。
今年7月WAIC上,平头哥宣布启动T-Head SAIL开源,向开发者提供SDK、驱动、性能分析与调试工具及技术文档。云栖大会上,团队公布进一步进展,已开源项目包括PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目。
随着更多工具开放,SAIL让开发者能深入了解软件实现,并根据业务需要修改代码。这些资源精准回应了开发者的三大核心痛点:
降低迁移成本,保留历史技术积累
“最大的诉求是迁移成本。”平头哥半导体软件生态资深总监陆生华表示。客户软件多已在线上运行多年,代码和工具几经迭代,更换芯片意味着积累需重新检验且业务不能中断。框架适配与迁移工具旨在尽可能保留这些积累,让开发者沿用熟悉的方式,由工具辅助处理已有代码。只有历史积累越容易带走,国产AI芯片才越能成为实际可用的选择。
深度优化性能,提升算力使用效率
迁移跑通只是第一步。若更换芯片后效率大幅下降,业务难以接受。“同一个模型能否跑得更快、资源更省”成为关键。DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目的开源,让开发者不仅能使用工具,还能查看底层实现,根据自身模型和业务负载进行深度优化。业务团队可自行定位与解决问题,真正参与到芯片性能优化中。
加速新模型适配,实现Day 0部署
开发者迫切希望在新模型发布当天即可试用。面对模型几周一更的节奏,Day 0可用已成为客户对算力平台的期待。截至2026年9月,平头哥在ModelScope上已提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超34.8万次。
已适配的模型大幅减少了用户的准备工作。同时,TensorFlow、JAX适配版本、自研推理引擎及通信组件等也在推进开源。未来,开发者可将业务迁至真武,并按需修改、优化甚至开发新工具。
代码开源后,开发者深度参与生态共建
这些变化已在小鹏、蚂蚁和小红书等客户的实践中得到验证。
小鹏汽车:平滑迁移现有业务至新平台
借助SAIL,小鹏将原运行在GPU平台上的业务模型迁至真武云端集群,开展智能驾驶模型训练。团队利用SAIL的性能分析工具定位瓶颈并优化。SAIL支持C++、Triton、TileLang等开发方式,减少了重新学习成本,让团队专注于模型和业务本身。
蚂蚁集团:模型适配后的持续深度调优
蚂蚁集团推理服务团队已基于SAIL,在真武810E和M890上完成主要前沿模型的推理适配。目前,量化、推理阶段分离、专家并行负载均衡等优化工作仍在推进。在解决功能问题后,团队正不断改善处理效率和资源开销,软件优化将伴随业务长期进行。
小红书:自主开发自动化工具赋能业务
基于SAIL开源代码,小红书面向真武架构开发了模型迁移与算子优化Agent,以自动化方式加速生成式推荐模型部署。客户将自身模型经验融入工具,厂商的基础实现成为下一轮开发的起点。这解决了客户开发高性能算子时需保护知识产权的矛盾,核心逻辑留在内部,团队根据公开硬件信息编写定制算子。愿意公开的工具可提交给社区,经评审后合入主线。
开源后,已有阿里内外客户提交代码贡献,并提出丰富具体的反馈。
这些需求也在反哺平头哥的软件开发。真武架构信息已公开,团队正推动软件组件解耦发布,并将适配成果逐步提交回上游社区。代码开放后,如何让单个客户的改进惠及整个生态,是平头哥接下来的工作重点。
阿里此时进一步开放的战略考量
理解这一时间点,需回归芯片本身:只有当足够多的客户拿到硬件并投入业务,适配和优化的真实需求才会涌现。
从含光800、倚天710到真武系列,平头哥始终坚持从业务需求出发,先在内部验证再服务外部。外部客户常关心“阿里自己是否使用过”,淘宝、搜索等业务承担了早期生产验证角色。经实际流量和稳定性考验后,产品才向外推广。到真武M890,团队已完成两代完整芯片交付。软件的成熟度与客户需求,共同促成了此时的全面开放。
650多家客户意味着厂商需面对越来越多差异化问题。车企训练模型、互联网企业优化推荐,各自的计算方式和瓶颈不同。客户越多,将所有贴近业务的开发留给芯片厂商越难以为继。此时扩大开放,既有经过验证的软件,也有愿意参与开发的用户。
此外,这也关乎长期维护成本。若长期维护基于主流框架修改的独立版本,上游每次更新都需重新同步和测试。将适配和优化提交回PyTorch、vLLM、Triton等上游社区,能让真武的支持随主流软件同步演进,减轻重复维护负担。
当然,代码开放后,平头哥需建立长期协作能力,对社区提交改动进行评审和质量把控。
从更广视角看,SAIL的开放与阿里整体AI布局深度契合。
图源:阿里
今年云栖大会上,吴泳铭明确表示,阿里将长期投入AI模型、AI芯片和AI云。早在2025年2月,阿里便宣布三年内至少投入3800亿元建设云和AI基础设施,并在此后追加投入。
模型带来新算法与计算需求,芯片提供底层算力,SAIL通过编译器和算子库将模型需求在硬件上实现,再由云组织成服务交付用户。这层软件的跟进速度,直接影响新模型释放硬件性能的效率。
阿里内部已展开协同,平头哥正与千问团队合作,探索让模型生成高性能算子。尽管千问的需求无法涵盖所有行业,但T-Head SAIL的进一步开放,使得小红书、小鹏等企业能共同参与连接模型与硬件的软件开发,将业务理解转化为具体实现。
总体而言,阿里在模型、芯片和云上的持续投入,最终需由广阔的业务场景来检验。芯片交付后,软件的持续跟进与客户的自主开发能力,将决定这些投入能服务多大市场。
“生死看淡,不服就干”的平头哥,用多年投入积累了造芯与用芯能力。如今,它将更多经过业务验证的代码和工具交予开发者。大厂造芯,正式迈入生态建设的关键时刻。
SAIL全称“Seed of AI Library”(AI库的种子)。在平头哥看来,每一行开源代码都是一颗种子。芯片已进入真实业务,接下来,这些种子将在更多开发者手中,孕育出前所未有的工具、优化与应用。

