大数跨境

众智FlagOS 2.2正式发布!打通多芯片AI算力壁垒,跨芯性能提升27%

众智FlagOS 2.2正式发布!打通多芯片AI算力壁垒,跨芯性能提升27% 创新创业中关村
2026-10-01
5

大模型竞争正从模型能力本身,延伸到算子、编译、通信和运行时等系统软件层。面对 GPU、NPU、CPU 等 AI 芯片日益多元的格局,如何让一次模型适配、一次算子优化、一次系统调优,沉淀为更多算力可以共享的能力,成为 AI 开放计算的命题。

9月30日,众智 FlagOS 社区正式发布 FlagOS 2.2。目前,FlagOS 技术栈已覆盖21家 AI 芯片厂商,通过统一、开放的软件栈,让不同芯片共享模型适配、算子优化与系统性能提升成果,加速最新AI 模型在多元算力上的高效落地。

多芯片适配再扩展:统一框架接入,完善训推链路

FlagOS 2.2 持续扩展 vLLM、SGLang、PyTorch、Megatron 等框架的多芯片接入能力。其中,vLLM-Plugin-FL 完成 13 款芯片的全量支持,SGLang-Plugin-FL 支持8款芯片,首次发布的Torch-FL将多芯适配延伸到 PyTorch,共支持8款AI 芯片。

训练侧,Megatron-LM-FL、TransformerEngine-FL完成升级,FlagScale 增加慢节点检测、训练性能监控、进度心跳和权重转换,完善长时间训练所需的运行管理。

算子总量超1400,多芯片整体算子性能提升27%

FlagOS2.2持续扩充通用计算、推理专用与科学计算算子,发布清单覆盖 9 个算子库。其中,FlagGems 等公开算子由564个增至1454个,新增890 个;首次发布 FlagGems-SGLang,包含 40 个多芯片高性能算子。

统计接入量最大的 10 家 AI 芯片,跨芯片算子加速比中位数均值由 2.1 版本的 0.861× 提升至 1.099×,提升 27.58%,多芯片算子库性能已整体超过基线水平。

首次发布 CPU 编译能力:让新模型在 ARM 平台高效运行

FlagOS 2.2 首次将FlagTree-CPU作为独立编译组件发布,基于triton-cpu3.7.2,增加面向Arm64 SME2、SVE2和NEON I8MM 的编译支持,为W4A8、W8A8等低比特算子生成适合目标 CPU 的计算指令。

针对Prefill和Decode优化计算与调度,在Qwen3.8-27B、MiniCPM5-2B 等模型上,通过权重预打包、算子融合和已编译内核复用,优化提示词处理与逐 Token 生成阶段。近期 ARM Day 0 适配已覆盖轻量语言模型、百亿参数稠密模型、MoE 模型和文生图模型。

首次发布 FlagOS-Compressor:统一跨芯片量化

FlagOS 2.2 首次发布 FlagOS-Compressor,为跨芯片部署提供统一的权重转换与量化工具。面向万亿参数级BF16模型,通过INT8/INT4量化减少权重占用与搬运量;面向FP8、MXFP4等低精度及混合精度权重,支持格式转换并重新量化为 INT8,使存量设备获得运行新模型的更多选择。

在Qwen3.5-397B-A17B适配中,FlagOS-Compressor对Attention和 MoE专家网络执行W8A8量化,视觉编码器保持BF16,模型体积减少 49.1%,并完成双平台推理验证。

首次发布 FlagPrism:统一调试工具提升跨芯片算子开发效率

FlagOS 2.2 发布FlagPrism,首次实现跨芯片的Triton算子Debug与 Profiling。它作为FlagTree的子模块与编译器深度集成,在编译期和运行期两级观测Triton kernel,让开发者在英伟达GPU 和各类国产AI 加速器上使用同一套观测工作流。

目前FlagPrism已支持华为昇腾、天数智芯、摩尔线程、英伟达、燧原等后端,后续硬件覆盖将通过统一接口持续扩展。

面向 AI Agent 与量智融合,持续拓展开放计算

KernelGen将代码生成、测试验证与性能优化衔接到真实仓库的开发流程。本轮 FlagGems 版本迭代中,已有436 项带有KernelGen标记的贡献 PR。配套的KernelGenBench 通过多芯片性能基线、Token 用量分析和防作弊检查,为不同生成方案提供可比较、可复核的评测依据。

FlagQuantum是一个 PyTorch 原生的可微量子计算与量子AI 框架,支持状态向量、MPS、张量网络及多 GPU/多节点分布式模拟,让开发者像训练神经网络一样训练量子模型。

2026年10 月17日—18日,2026人工智能开放计算大会暨众智FlagOS 技术大会将在北京中关村国家自主创新示范区展示中心举行,大会将进一步展开多芯系统、端侧推理、AI Agent 和量智融合的技术讨论,并安排实操工作坊。

从适配到交付:质量验证、模型资源与社区共建

FlagOS 2.2 实现测试覆盖范围的全面提升,覆盖算子数值精度、训练推理插件基础能力、模型训推能力、多芯兼容性适配等。截至9月30日,发布质量主统计中的99个问题已解决95项,其中68个P0问题全部解决。

本季度,FlagOS单季度已支持7个模型的Day0多芯适配,单模型最多覆盖 12 个平台/设备。FlagRelease 已发布 300 多个模型镜像,按芯片、精度与部署方案提供模型资源,开发者可在 HuggingFace、魔搭及焕新社区查找模型卡与部署说明。

从框架插件、编译器后端到算子测试,FlagOS 的演进来自社区持续贡献。按 GitHub flagos-ai 组织统计,2.1到2.2发布期间,合并 PR 数量达到原来的约2.6倍,代码提交接近翻倍,开发贡献与社区反馈同步增长。

FlagOS 2.2 版本官方下载渠道:用户可访问 FlagOS 官网(https://flagos.io/resourcedownload)获取版本镜像,注册后可直接下载,覆盖相关芯片的镜像版本。

关于众智 FlagOS 社区:为解决不同 AI 芯片大规模落地应用,北京智源研究院联合众多科研机构、芯片企业、系统厂商、算法和软件相关单位等共同发起并创立了众智FlagOS 社区,目前已有100多家成员单位。FlagOS是一款专为异构 AI 芯片打造的开源、跨芯系统软件栈,支持 AI 模型一次开发即可无缝移植至各类硬件平台,降低迁移与适配成本。

综合整理智源FlagOpen公众号

<PAST · 往期回顾   >


△ 当“三新”遇上“刚需”:一场政府搭台的精准匹配|新技术·新产品·新场景

△ 一批前沿创新成果集中亮相,展现AI医药融合创新赛道新突破|奇点创智系列活动

【声明】内容源于网络
0
0
创新创业中关村
欢迎关注中关村科技园区管理委员会官方账号。发布权威信息、解读重大政策、搭建互动平台,“创新创业中关村”带您随时随地获取中关村最新政策和申报信息。
内容 6559
粉丝 0
创新创业中关村 欢迎关注中关村科技园区管理委员会官方账号。发布权威信息、解读重大政策、搭建互动平台,“创新创业中关村”带您随时随地获取中关村最新政策和申报信息。
总阅读92.0k
粉丝0
内容6.6k