大数跨境

The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash

The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash DeeplearningAl
2026-09-09
7

在一周多的时间里,OpenRouter 上使用最广泛的模型身份成谜。上周,该模型正式揭晓为 Z.ai 推出的全新 GLM-5.3-Flash。令人瞩目的是,其免费高流量预览版完全由中国制造芯片支持,且权重现已公开 downloadable。

最新消息:GLM-5.3-Flash 正式发布

Z.ai 正式发布了视觉语言模型 GLM-5.3-Flash(此前代号为"Ox Alpha")。这是该公司自今年 4 月推出 GLM-5V-Turbo 以来的首款视觉模型,也是 GLM-5 家族中首个原生构建视觉能力而非后期附加的模型。

核心参数与特性

  • 输入/输出:支持文本、图像和视频输入(最高 1,048,576 tokens),文本输出(最高 128,000 tokens,速度 44.6 tokens/秒)。
  • 架构:采用混合专家(MoE)Transformer,结合线性注意力与稀疏注意力机制。总参数量 3200 亿,每次推理激活 180 亿参数。
  • 功能特性:支持可调推理级别(低、高、max),具备流式输出、工具调用及上下文缓存能力。
  • 性能表现:在 Artificial Analysis 智能指数中获 57 分;在 GDPval-AA v2(真实世界知识任务)榜单中位列所有模型第三,是开放权重模型中的最佳表现者。
  • 获取方式:可通过 GLM Coding Plan 订阅(月费 18-168 美元)或 API 调用(输入/缓存/输出价格分别为 0.15/0.03/0.50 美元/百万 tokens)。
  • 开源许可:权重可在商业友好的 MIT 许可下免费下载。
  • 未披露信息:知识截止时间及预训练数据来源暂未公布。

工作原理:原生多模态与混合注意力

Z.ai 从零开始预训练 GLM-5.3-Flash,原生融合文本、图像和视频处理能力,摒弃了传统拼接视觉与文本 Transformer 的方案。针对长输入处理,模型重新设计了注意力层以提升效率。

技术创新点

  • 混合注意力机制:首创结合线性注意力(低成本、关注邻近上下文)与稀疏注意力(关注完整上下文)。该组合将计算量降至 GLM-5.3 的约三分之一,优于 DeepSeek-V4-Flash 和 Kimi K3。
  • 内存优化(IndexPool):通过每四个检索向量合并为一个的策略,显著降低百万级 token 上下文下的内存占用,使键值缓存降至 GLM-5.3 的四分之一以下。
  • 高效扩展技术:基于 30 万亿 token 多模态语料预训练,采用 DeepSeek 开发的“流形约束超连接”技术,确保多层并行连接的稳定性。
  • 强化学习训练:利用可渲染前端、游戏或 3D 场景的环境生成训练数据,并根据最终渲染效果对模型进行强化学习打分。
  • 推理加速:每个 token 仅激活 288 个专家中的 8 个,使用 45 层网络(GLM-4.5 为 92 层),并引入多 token 预测层提前起草内容以加快生成速度。

性能表现:极致性价比

独立评测显示,GLM-5.3-Flash 虽略低于顶级开放权重模型的绝对性能,但其单项任务成本仅为竞品的八分之一,远低于专有模型(后者成本高出 10 至 35 倍)。在真实世界工作评测及长周期编码任务中,其表现媲美成本高出 16 倍的 GLM-5.3。

基准测试数据

  • Intelligence Index:得分 57 分,平均每项任务成本仅 0.09 美元。相比 Kimi K3 和 GLM-5.3(均为 60 分,成本分别为 0.84 和 0.68 美元),性价比极高;表现持平 Claude Opus 4.8(成本 2.03 美元),优于 Gemini 3.7 Flash。
  • GDPval-AA v2:排名第三(Elo 1,765),仅次于 Claude Opus 5,领先于 Grok 系列及 GLM-5.3。
  • DeepSWE v.1.1(软件工程技能):一次性解决率 63%,单项成本 0.24 美元。相比之下,GLM-5.3 解决率 69% 但成本高达 3.99 美元;Claude Opus 5 解决率 74% 但成本达 11.84 美元。
  • 局限性:模型输出较为冗长,生成速度(平均 45 tokens/秒)慢于 GLM-5.3(78 tokens/秒)及行业平均水平(69 tokens/秒)。

新闻背后:从匿名预览到开源发布

发布前一周,Z.ai 以"Ox Alpha"为名在 OpenCode 和 OpenRouter 平台独家免费预览,成功收集开发者反馈并登顶热门模型榜。用户通过 tokenizer 特征迅速推测其归属。8 月 26 日,Z.ai 确认模型身份并在 MIT 许可下开源权重。随后发布的旗舰模型 GLM-5.3 虽同样开源,但增加了针对年收入超 100 亿美元企业的商业安全审查条款。

重要原因:架构进化的里程碑

尽管 GLM-5.3 在纯文本基准上仍占优势,但 GLM-5.3-Flash 凭借全新的基础架构和原生多模态能力,展现出更高的先进性与通用性。Z.ai 表示,下一代旗舰模型将继承此混合注意力架构,并通过更多数据训练进一步提升能力,有望挑战顶级专有多模态模型。

行业观察:国产芯片的规模化潜力

GLM-5.3-Flash 的匿名预览不仅制造了市场话题,更揭示了一个关键事实:该模型完全依赖中国本土芯片运行。这证明,通过高效的内存优化算法,企业完全可以在经济型硬件上规模化部署高性能模型。尽管其在速度和体量上尚未达到前沿模型的常规标准,但其展现的成本效益比具有深远的战略意义。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1322
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读20.1k
粉丝0
内容1.3k