大数跨境

GLM-5.3-Flash、Qwen3.8-Flash-Next 同日开源:一个压服务成本,一个预演 Qwen4

GLM-5.3-Flash、Qwen3.8-Flash-Next 同日开源:一个压服务成本,一个预演 Qwen4 AI大模型智能体前沿
2026-08-27
1
导读:真正该比较的不是每百万 Token 单价,而是一项 Agent 任务完成前消耗的全部调用与算力

导读GLM-5.3-Flash 与 Qwen3.8-Flash-Next 同期开放权重,一个每 Token 激活 18B 参数,一个激活 6B。两者都在混合注意力、稀疏检索和系统协同上做减法,却走出了不同路线。这场碰撞真正改变的,不是谁在某张榜单上高几分,而是前沿模型开始认真计算:每一份算力究竟能换来多少有效工作。

两款 Flash 撞在一起,不只是名字巧合

2026 年 8 月 26 日,两款带着“Flash”的开放权重模型进入同一张牌桌。

一边是智谱的 GLM-5.3-Flash。它此前以 Ox Alpha 的匿名身份在 OpenRouter 和 OpenCode 接受真实流量测试,正式发布时公布的规模是 320B 总参数、18B 激活参数。另一边是 Qwen3.8-Flash-Next:125B 主模型,每个 Token 激活 6B,另外还有 51B 的 N-gram Embedding,并且提前展示了 Qwen4 将采用的架构方向。

如果只看名字,很容易把 Flash 理解成旗舰模型的轻量版。但这两款模型都在重新安排计算:把历史压进固定状态,只在需要时检索部分上下文,把部分容量挪到加速器之外,再协同优化训练与推理系统。

因此,不能只拿总参数或跑分做胜负表。真正可比的是:计算花在哪里,又省掉了什么。

先统一口径:18B 和 6B 到底代表什么

GLM 的 18B、Qwen 的 6B,都是每个 Token 实际激活的主干参数量,不是模型下载后只占这么多内存。

MoE(混合专家模型)由路由器为每个 Token 选择少数专家。激活参数越少,通常意味着主干计算量更低;但完整权重仍要存储,KV Cache、跨卡通信和视觉编码也不会消失。

这几项成本不能按一个参数量同比换算:总参数结合权重精度决定权重存储;激活参数主要影响每个 Token 的主干计算;KV Cache 则主要由上下文长度、注意力层数、KV Head 数、每个注意力头的维度和缓存精度决定,并不直接随总参数或激活参数同比变化。

Qwen 还另有 51B N-gram Embedding。这个表可放在主机内存并异步预取,以较少额外 FLOPs 增加容量,却依然需要存储和带宽。因此,“6B 激活”不能翻译成“6B 模型的部署成本”。

社区发布讨论中,一个集中疑问是:两款模型对普通本地设备仍然太大。一名用户报告,Qwen 的 87GiB Q4 量化版本可在 128GB 统一内存设备上运行,但当时依赖尚未合并的 llama.cpp 支持和额外修复。它证明了可运行,不代表普通开发者已能轻松部署。

所以,第一条判断很简单:Flash 描述的是效率方向,不是统一尺寸,更不是“小模型”的认证标签。

GLM 的路线:从注意力一路抠到国产芯片

GLM-5.3-Flash 把重点放在长上下文服务成本上。它采用三层线性注意力搭配一层稀疏注意力的混合结构:线性注意力用递归状态保留局部和连续信息,稀疏注意力再从长上下文中找回真正相关的全局片段。

“找哪些内容值得注意”本身也要花钱。IndexPool 先把索引器的 4 个 Key 缓存向量池化成 1 个,再进行 Top-K 选择。

图片说明:左侧展示 GLM-5.3-Flash 的混合注意力与 IndexPool,右侧是官方给定口径下逐层 KV Cache 和注意力计算对比。图片来源:Z.ai GLM-5.3-Flash 官方博客

按 Z.ai 公布的逐层、逐 Head、BF16 口径,相比 GLM-5.3,Flash 版本的注意力计算量下降约 3.01 倍,KV Cache 缩小约 4.44 倍。这个结果很重要,但边界也要说清:它不是端到端吞吐,更不是与 Qwen 在同一硬件上的直接对决。官方图甚至明确显示,GLM-5.3-Flash 的 KV Cache 仍略高于其中对照的 Kimi-K3 和 DeepSeek-V4-Flash。

GLM 更有辨识度的部分发生在模型之外。官方称,Ox Alpha 的真实请求由国产芯片集群承载。团队在 SGLang 上构建专用引擎,加入 ReplaySSM、W8A8、混合精度缓存,以及分离多模态编码、Prefill 和 Decode 的 EPD 架构。

相对同一硬件上的初始基线,官方报告端到端服务性能提高了 3 倍。这里能得出的稳妥结论,不是国产芯片已经在所有任务上等同某款 GPU,而是模型架构、并行方式、量化和调度必须共同设计,低激活参数才能真正变成服务成本。芯片型号、实际启用规模和第三方复现尚未公开,这条边界也必须保留。

Qwen 的路线:不只少算,还把容量搬出去

Qwen3.8-Flash-Next 同样采用“线性记忆 + 全局检索”的混合思路,但具体结构不同。

每四层中,三层使用 Gated DeltaNet(GDN),把历史压缩进固定大小的循环状态;一层使用 Qwen Sparse Attention(QSA),保留直接访问远距离 Token 的能力。QSA 不再让索引器逐 Token 搜索,而是先把上下文聚合成 micro-block,在块级别估计相关性,再对选中的区域执行稀疏注意力。

图片说明:Qwen 每四层交替使用三层 GDN 与一层 QSA,同时引入四分支 Gated Residual、N-gram Embedding 和 MTP。图片来源:Qwen3.8-Flash-Next 技术报告 Figure 1

技术报告给出的 1M 上下文实验中,QSA 相对稠密 GQA 的注意力模块在 Prefill 和 Decode 阶段分别达到 7.6 倍和 4.9 倍加速。这里同样要盯住限定词:这是 kernel-level 的注意力模块测试,不是完整模型端到端速度

Qwen 还从三处继续压效率:Gated Residual 把残差流扩成四条分支,以动态门控制读写;N-gram Embedding 把部分局部模式容量放到加速器之外;Muon 优化器则重新处理正交化、参数分工和融合矩阵,并重新拟合学习率与批量大小。

结果是,相比 Qwen3.7-Plus,Qwen3.8-Flash-Next 使用约三分之一的激活参数、三分之一的训练 Token,训练 FLOPs 约为九分之一。在 14 个预训练基准中,它有 8 个领先,其余 6 个最多落后 2.6 分。但这是 Base 模型与官方评测口径,能支持“预训练效率明显提高”,不能直接改写成“产品能力全面超过前代”。

GLM 更像是在回答:一套前沿模型怎样在真实集群上便宜地服务。Qwen 则更系统地回答:架构、容量和训练稳定性怎样一起重做。共同点是,它们都不再把效率当作模型训练完成后的部署补丁。

每百万 Token 只是单价,Agent 要算整项任务

到了 Agent 场景,Token 单价越来越像出租车的每公里价格:有用,但它不会告诉你绕了多少路、堵了多久,最后有没有到目的地。

一个模型单次调用很便宜,如果计划经常遗漏步骤、工具调用失败后反复重试,完整任务仍可能更贵。反过来,一个单价略高的模型若能减少轮次、复用缓存并稳定完成任务,总账未必更差。

因此,开发者评估这类 Flash 模型,至少要拆开五件事:

成功率:在自己的代码库、办公流程或视觉任务上,最终交付是否通过验收。

总 Token:输入、缓存输入、思考与输出合计多少,而不是只看一次请求。

延迟:Prefill、Decode、工具等待和失败重试分别耗时多少。

部署代价:完整权重、量化损失、KV Cache、内存带宽与跨卡通信能否承受。

稳定性:同一任务多跑几次,计划遗漏、提前结束和格式错误是否可控。

目前公开证据还不足以宣布 GLM 与 Qwen 谁赢。两家的测试条件并不统一:Qwen 的技术报告提供了更完整的训练和 Kernel 消融,GLM 则公开了更多国产芯片服务栈信息。把这些数字强行合成一个总分,只会制造精确的错觉。

但两款 Flash 同期出现,已经给出一个更值得记住的信号:大模型没有停止追求能力,只是“更大”不再自动等于“更先进”。下一阶段真正难复制的,可能是让模型少激活一些参数、少搬一些缓存、少走几轮弯路之后,仍然把任务做完。

参数表还会继续变大。工程账本,终于开始变细。

参考资料

GLM-5.3-Flash 官方博客: https://z.ai/blog/glm-5.3-flash

GLM-5.3-Flash 官方模型卡: https://huggingface.co/zai-org/GLM-5.3-Flash

Qwen3.8-Flash-Next 官方仓库: https://github.com/QwenLM/Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 技术报告: https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Qwen3.8-Flash-Next 官方博客: https://qwen.ai/blog?id=qwen3.8-flash-next

GLM-5.3-Flash 社区发布讨论: https://www.reddit.com/r/LocalLLaMA/comments/1vyy3k6/glm53flash_frontier_intelligence_flash_cost/

Qwen3.8-Flash-Next 本地部署案例: https://www.reddit.com/r/LocalLLM/comments/1vz5wa1/qwen38flashnext_125ba6b_running_on_strix_halo/

— THE END —

文章仅做学术分享,如有侵权请联系删除,非常感谢!

【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1111
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读17.0k
粉丝0
内容1.1k