7月18日,平头哥在世界人工智能大会上宣布,把自研的AI软件栈T-Head SAIL,开源了。
SAIL是平头哥为真武AI芯片打造的一整套配套软件。芯片造出来之后,还需要这套软件把开发者写的代码翻译成芯片能执行的指令,AI任务才能真正跑起来。
目前第一期开放了内核驱动、编译器和SDK软件包,后续还将分期开源通信库、计算加速库和推理引擎。
平头哥同时给出了一个数字:面对持续更新的主流AI推理框架,SAIL适配最新版本的平均时间小于7天。适配完成后,开发者无须再对底层硬件进行额外适配和调优,就能使用新版本带来的算子、特性和优化能力。
一颗已经造出来的芯片,为什么还需要等软件适配?
AI芯片本质上是一块能进行大规模数学运算的硅片。它速度极快,却只认识自己的底层指令。开发者用Python这样的编程语言写AI程序,写出来的代码直接交给芯片执行,后者是完全看不懂的。
SAIL做的就是中间的"翻译"和"调度":把开发者写的代码变成芯片能执行的指令,让运算尽可能快地完成,协调多张芯片共同工作,并帮助开发者定位运行中出现的问题。
打个比方,芯片是发动机,SAIL是变速箱和整套传动系统。发动机再强,没有传动系统把动力送到车轮上,车也跑不起来。
一款新模型从发布到在芯片上稳定运行,中间要过好几道关:推理框架要能识别芯片,模型用到的计算操作要逐个适配,编译器要正确翻译代码并管理好显存,多张芯片一起算的时候还要打通通信,最后还要验证速度和精度。
平头哥说的"不到7天",就是SAIL完成这套适配流程所需要的时间。
这个速度为什么越来越重要?
因为AI行业的重心正在从训练转向推理,也就是让训练好的模型真正能运行起来,对外提供服务。研究机构Gartner预测,2026年推理工作负载将占到AI基础设施支出的一半以上,并且首次超过以训练为主的工作负载。
推理场景下,模型和工具的更新速度已经快到按周计算。vLLM和SGLang是目前最主流的两个开源推理框架,仅2026年5月到7月就连续发布了多个版本,包含新模型支持、新硬件适配和大量性能优化。
越来越多的开发者通过这类框架来使用算力,他们往往先选推理框架,再看哪些芯片能接入。
对芯片厂商来说,竞争的入口变了:你要在开发者已经在用的框架里,第一时间把最新的模型跑起来。
当适配速度比芯片本身的计算能力更影响客户选择,AI芯片的竞争就从硬件转到了软件。
软件竞争拼的是速度,而软件的速度上限,取决于它与芯片结合得有多深。
这就是为什么平头哥选择自研SAIL,并和真武芯片做软硬件协同设计(Co-Design)的原因。编译器怎么拆任务、算子怎么实现、显存怎么分配、多卡怎么通信,都会直接影响真武的速度、稳定性和集群效率。
SAIL可以针对真武的硬件架构做深度优化,这种优化来自芯片架构师和软件工程师之间持续、紧密的反馈:他们坐在同一家公司里,可以一起设计、一起调试、一起迭代。
而相比之下,第三方通用软件栈需要同时兼容多种硬件,很难持续为某一款芯片做到同等深度的定向优化。
欧洲智库Bruegel在今年的研究中指出,没有规模化的芯片设计能力,就很难构建有竞争力的软件平台,因为缺少芯片架构师和软件开发者之间的紧密反馈环。并且这种协同设计还会产生复利效应。真武在生产环境中碰到的问题,不只回灌到SAIL的软件更新里,也会反馈到下一代芯片的架构设计中,让新一代产品都比上一代优化得更深、适配得更快。
自研软件栈对客户来说同样重要。
芯片厂商自己掌握软件栈,意味着客户在模型适配、框架跟进和问题排查上能得到更快的响应,不用等第三方软件厂商的排期。
客户迁移越顺畅、适配等待的时间越短、排查故障的效率越高,国产芯片进入业务的门槛就越低。
从更大的视角看,国产AI芯片已经进入"硬件能造出来,软件也要跟得上"的阶段。
如果芯片长期依赖海外底层软件,模型迁移、性能优化和版本迭代仍然会受制于外部平台的节奏与规则的限制。
SAIL补齐了从芯片、驱动、编译器、算子库到上层框架的完整国产软件链路,让这条链路拥有独立、持续迭代的能力。
Co-Design让SAIL有能力做深度优化,但优化的方向和优先级从哪里来?
真武芯片目前累计出货56万片,进入了电力、金融、汽车、互联网等20多个行业,服务400多家客户。这些芯片不是只在实验室里跑测试,它们承接着真实的业务流量,不同行业给SAIL带回来的真实业务场景问题完全不同。
在智驾领域,真武芯片已经部署超过13万张卡,覆盖30多家车企。这个场景对推理延迟要求极高,差几毫秒就可能影响驾驶决策。
在金融领域,真武芯片部署超过10万张卡,服务150多家机构。这个场景要求模型更新快、审计可追溯,对系统稳定性的容忍度几乎为零。
在运营商领域,在中国联通三江源绿电智算中心的项目中,平头哥提供了16384张算力卡,提供的算力占到了整个项目的54%。当上万张卡一起同时跑,芯片间的通信瓶颈和任务调度问题都会被急剧放大。
到了互联网推理场景,几千个用户同时发请求,对并发处理和单位推理成本的要求,和前面几个行业又完全不同。
延迟、稳定性、大规模通信、高并发——这些问题进入SAIL的每一轮更新,推动软件越跑越稳、越跑越快。
这些真实的大规模部署,也在向整个市场证明一件事:国产AI芯片已经进入要求极高的生产环境,并能在最严苛的生产环境中稳定运行。
真武芯片的出货量,可以转化成SAIL的软件迭代速度。平头哥拥有的核心资产,既包括芯片本身,也包括芯片在真实环境中不断返回的真实问题。
AI芯片的软件护城河,正在从代码积累转向生产反馈速度。
这种反馈速度,体现在AI超维度关注的三个时间指标上。
第一个是新模型适配速度,也就是Time-to-model。
SAIL已经适配了PyTorch和vLLM、SGLang等260多个主流AI训练、推理框架及相关工具,而且,这种适配不是停留在某一版本上,而是持续跟进主流推理框架的迭代。按照平头哥公布口径,SAIL适配最新版主流推理框架的平均时间不到7天。
同时它还支持多种主流框架,开发者不需要完全绑定在某一个特定的工具链,用vLLM可以,用SGLang也可以。切换框架时,不需要重新适配芯片。
第二个是代码迁移时间,也就是Time-to-port。
SAIL兼容英伟达CUDA主流AI生态编程接口,开发者迁移已有的程序时,只需要重新编译一遍代码,就能在真武芯片上直接运行,过去的调优经验也能继续复用。迁移门槛由此被明显降低。
第三个是问题排查的效率,也即Time-to-debug。
SAIL已经把各种性能分析、调试工具全部对开发者开放,后续还会将驱动程序部分开源,开发者未来碰到问题时,可以直接自己查代码,定位原因,甚至直接修复后提交给社区。
那么,一套如此重要的软件,平头哥为什么要把它的代码公开?
在AI芯片行业,如果代码和工具始终锁在公司内部,全部适配工作就只能由平头哥自己的团队完成。行业越多、主流框架更新越快,这支团队就越容易成为整个生态的速度上限。
开源是在主动拆掉这个上限。
__如今推理场景正在快速扩展到越来越多的行业,而每个行业的模型和部署需求都不一样。__只靠内部的软件团队,逐个行业、逐个模型去做适配,速度终归有限。而最了解每个行业需求的,往往是身处那个行业里的开发者自己。
开源相当于把软件适配团队的边界,从一家公司扩展到整个开发者社区。
这对各方意味着什么?
对开发者来说,获得源代码和底层工具意味着,碰到问题不再只能提工单排队等厂商处理,而是可以自己查找原因,甚至直接提交修复方案。同时,SAIL对多种主流框架的支持,也减少了开发者被单一框架和工具链锁定的风险。
对整个国产芯片行业来说,SAIL提供了一套经过大规模生产验证的开放软件栈样本,把竞争从"能不能造出芯片",推向了"能不能让开发者持续、低成本地使用芯片"。
对平头哥来说,这笔账更不难算。更多开发者使用SAIL,意味着更多行业场景的问题会被发现和解决,SAIL对新模型、新框架和新需求的响应速度也会进一步加快。
生态扩大生产反馈 → 生产反馈改善软件 → 软件又降低芯片的使用门槛,这是平头哥真正想要转起来的飞轮。
而站在阿里整体业务的角度,SAIL降低了真武芯片的使用门槛,也有助于推动更多业务迁移到以真武为基础的云上算力,阿里可以把真武芯片、阿里云服务和模型部署打包成一套完整的解决方案交付给客户——从算力,软件到云服务,客户不必再自行拼接不同厂商的组件。
有一种行业观点认为,开源只能解决"可用性"——代码公开了、开发者能用了——但不一定能解决"最优性"。
因为真正的优势,往往藏在编译器和调试工具背后的工程经验里,这些无法完全写进文档的隐性知识,通常最难复制。
这个观察有道理。但SAIL不一样的地方恰好在这里:它开源的代码背后,沉淀着20多个行业、几年真实业务跑出来的工程经验,这些经验已经写进了编译器的优化策略、算子库的实现方式和调试工具的诊断逻辑里。
换句话说,SAIL的开源不只给了代码层面的可用性,也给了这些隐性知识的可见性。
CUDA经过长期积累形成的软件生态依然强大。但推理时代增加了一种新的竞赛方式:每当一个新的模型或新的推理框架发布,芯片厂商都要重新比一次响应速度。
这场竞争不再只发生在晶圆厂里,也发生在每一次新模型、新推理框架发布后的七天里。
-END-
获取更多AI非共识!

