智谱正处于"能力兑现"的早期加速阶段,短期需跟踪Cowork场景商业化进度与下一代基座模型表现,中长期需观察Self-training飞轮是否真正跑通。在全球AI竞赛中,智谱已证明中国模型公司可以通过成本效率、后训练深度和垂直场景渗透,走出一条差异化的商业化路径。
一、业绩会核心内容总结
1. 战略定位:从"智能上界"到"能力兑现"
智谱将自身战略演进划分为明确阶段。如果说2025年的关键词是"智能上界",2026年上半年的核心主题则是"能力兑现"——模型首次被证明不再只是工具,而是能够独立完成一项完整任务。
公司提出核心公式:AGI商业价值 = 智能上界 × Token消耗规模。智能上界决定任务边界与单位Token价值密度;Token消耗规模反映智能被使用的广度与深度。两者相乘构成商业空间。
模型能力演进被定义为五个阶梯式阶段:
Chat:交付一次性回答
Coding:交付可运行代码(当前已验证)
Agent:交付执行完成的多步任务链(当前重心)
Cowork:交付可由专业人士复核的工作成果(正在打开)
Autonomous AI:交付持续运行的能力(远期目标)
每跨越一级存在具体技术门槛:Coding→Agent需长程规划与错误恢复;Agent→Cowork需可靠性达专业人士复核标准;Cowork→Autonomous AI需模型自主判断结果正确性。
2. 技术与产品:GLM-5系列的迭代逻辑
GLM-5系列采用"同一基座+深度后训练"的迭代策略。7450亿参数基座在年初已完成训练,通过在同架构上依次推进5.1、5.2、5.3及相应训练环境,实现能力持续释放而非简单堆砌参数。
|
|
|
|
|
|---|---|---|---|
| GLM-5 |
|
|
|
| GLM-5.2 |
|
|
|
| GLM-5.3 |
|
|
|
| GLM-5.3 Flash |
|
|
|
关键验证:GLM-5.3证明Scaling不只有参数维度,训练深度(后训练)是当前提升空间最大的因素。同时,GLM-5.3 Flash以匿名身份在OpenCode/OpenRouter接受真实调用检验,验证了前沿智能也可进入普惠场景。
Coding能力向专业场景迁移:
网络安全:CyberGym得分84.5%(超过WABO5与GPT-5.6 SOLO);ExploitGym完成130项任务。与多家安全团队合作,累计发现漏洞约2,436个,其中超1,000个高危,覆盖269个项目。
下一步迁移方向:数据分析、复杂自动化、法律、金融等高价值专业工作。
3. 财务表现:收入结构历史性翻转
核心财务数据(2026年上半年):
总收入:9.54亿元人民币(1.42亿美元),同比增长近400%
开放平台及API收入:8.25亿元(1.23亿美元),同比增长超27倍,占总收入86.5%(去年同期仅15.2%)
ARR(按8月收入年化):16亿美元;若按周数据年化口径,已超20亿美元
研发支出:21.3亿元(3.17亿美元)
期内亏损:20.72亿元,同比减少12.1%,亏损率收窄4.7倍
经调整净亏损:19.64亿元,亏损率收窄3.5倍
关键经营指标:
MaaS平台Token调用量较年初增长超40倍;CodingPlan调用量增长超23倍
API平均定价提升约101%(量价齐升)
开放平台及API业务毛利率:从-0.4%提升至24.6%(同比提升25个百分点)
注册用户超740万(较年初+144%);付费日活较年初增长603%
前十大用户日均调用量较年初增长98倍
高质量客户(ARR>1000万)达8个,其中超2.5亿美元2个
单位经济模型拐点:
经调整净亏损(19.64亿元)低于研发投入(21.3亿元),表明业务贡献的毛利润在覆盖管理费用和销售费用后,已开始逐步反哺研发投入。
算力乘数(每1元算力投入对应的开放平台及API收入)较去年同期提升14倍。
4. 基础设施与国产芯片:"国芯推国模"取得突破
规模:已在约10万卡级国产芯片集群上实现规模化、低成本推理。
成本:单位Token推理成本较年初下降80%。
验证:GLM-5.3 Flash匿名上线时,后台全面使用国产芯片集群,6天内承接约60万亿Token调用,在OpenRouter等平台历史级大流量下保持服务稳定。
效率:通过GLM-5.3驱动的Infra Agent自主优化,端到端服务性能相比初始基线提升约3倍,算子开发周期缩短一半。
意义:在全球算力供给紧张背景下,智谱已开始掌握自身的成本曲线,推理供给不再依赖单一进口渠道。
5. 未来技术愿景:Self-Training与递归式自我提升
智谱提出终极技术路径——Fully Self-Training(完全自训练),即模型能够:
数据自产:通过model vs. model自我对弈,数据质量上限取决于模型自身验证能力;
环境自造:研究智能体采集任务模式,裁判智能体验证,环境自动合成;
基础设施自优化:推理系统优化本质上是代码工程任务,由模型驱动的Infra Agent完成。
这三条线指向同一终局:模型参与自身改进,形成递归式自我提升(RSI)。下一代GLM将在上一代GLM搭建的环境中实现自训练。
下一代基座模型已在训练中,方向包括:
更大的有效规模
更长的原生上下文
原生多模态统一建模
通过Loop Transformer等方式增加推理深度
二、投资分析
1. 核心投资逻辑:模型能力驱动商业飞轮
智谱的业绩会传递了一个清晰信号:模型能力的代际水平是产品与商业逻辑的起点。2026年上半年收入结构的翻转和量价齐升,验证了"先有能力,再有生意"的逻辑。
飞轮已经形成:
智能突破 → 打开更高价值任务边界 → Token调用量与定价双升 → 收入与毛利改善 → 反哺算力与研发投入 → 智能上界进一步提升
关键验证点在于量价齐升:API价格提升101%的同时,调用量仍增长40倍,前十大客户调用量增长98倍。这说明需求并非价格弹性驱动,而是模型能力提升后,客户愿意将更多真实高价值任务交给模型,并为更强能力付费。
2. 竞争壁垒:不是单点SOTA,而是持续迭代与成本效率
管理层对壁垒的认知非常清醒:"任何单点领先都有时限,Coding benchmark第一可能以周或月为单位被追平。"
真正的长期壁垒体现在:
持续迭代能力:11个月内6次迭代,智能指数从32提升至60,同时单任务成本稳定在0.2美元档位(Flash降至0.045美元)。
真实任务完成率:长时间、可执行、可验证的真实任务会放大模型差异。模型进入客户代码库、工具链和工作流后,切换成本不再是API单价,而是积累的prompt、agent workflow、权限体系和工程集成。
成本自主权:10万卡级国产芯片集群+自研Infra优化,使智谱在全球算力紧张背景下掌握自身成本曲线,单位Token成本下降80%。
3. 商业模式升级:从卖工具到卖结果
收入结构变化反映了商业模式的三级跳:
第一阶段(2025年前):本地化部署,卖工具(需集成定制);
第二阶段(2025年起):API/订阅制CodingPlan,卖调用量(模型从知识驱动走向任务驱动);
第三阶段(2026年):Agent/Cowork,卖端到端任务结果(模型承担完整工作流)。
这一升级的核心意义在于:客户购买的内容越来越接近最终经济价值和结果,单位Token的价值密度持续提升。当模型从Coding走向Cowork,客户购买标的将从Token转向任务结果,定价权从"每百万Token多少钱"转向"完成一个漏洞修复/一次数据分析多少钱"。
4. 财务健康度:亏损收窄,单位经济快速改善
毛利率转正:API业务毛利率从-0.4%跃升至24.6%,且仍在提升通道。
亏损率大幅收窄:期内亏损率收窄4.7倍,经调整亏损率收窄3.5倍。
研发效率:经调整净亏损已低于研发投入,说明业务毛利开始覆盖管理/销售费用后反哺研发,这是从"纯投入期"向"商业化正循环"过渡的关键信号。
客户质量:超千万美元ARR客户已达8个,其中2个超2.5亿美元,表明模型已切入大型企业核心工作流。
5. 风险因素
|
|
|
|
|---|---|---|
| 技术竞争 |
|
|
| 迭代持续性 |
|
|
| 算力约束 |
|
|
| 商业化广度 |
|
|
| 治理与安全 |
|
|
6. 估值与前景展望
估值锚点:
ARR口径:16-20亿美元(保守至激进口径),作为AI基础设施/模型层公司,海外可比公司(OpenAI、Anthropic等)通常以高倍数PS或收入增速定价。
收入增速:开放平台及API收入同比增长27倍,即使基数效应下增速回落,仍可能保持极高增长。
单位经济拐点:毛利率转正且快速提升,亏损率收窄,商业模式验证进入加速期。
关键观察指标:
Cowork场景扩展速度:网络安全之外,法律、金融、数据分析何时形成规模化收入;
下一代基座模型进展:是否能在有效规模、长上下文、多模态统一上实现突破;
海外业务进展:未来1-2个月可能与海外CSP平台达成合作,是估值重估潜在催化剂;
国产芯片经济性:能否在显存、带宽、长上下文约束下持续提升单位硬件产出;
Self-training验证:数据自产、环境自造、Infra自优化是否形成可量化的迭代加速。
三、投资总结
智谱2026年中期业绩会展现了一家中国大模型公司从"技术投入期"迈向"商业兑现期"的关键转折。
核心结论:
商业模式已验证:收入结构从本地化部署(15%)翻转至开放平台/API(86.5%),且API业务毛利率已转正至24.6%,证明模型能力可直接转化为可持续的商业价值。
量价齐升而非价格战:价格提升101%同时调用量增长40倍,说明智谱具备定价权,其根源在于模型能力打开了更高价值的任务边界(Coding→Agent→Cowork),客户为结果付费而非仅为便宜付费。
技术路线清晰且差异化:不盲目追逐参数规模,而是通过"基座复用+后训练深化"实现快速迭代(11个月6代);同时以Coding为meta ability,向网络安全等专业场景迁移,形成可扩展的能力矩阵。
基础设施自主可控:10万卡级国产芯片集群+Infra Agent自优化,使智谱在全球算力紧张背景下掌握成本曲线,单位Token成本下降80%,这是长期竞争的关键护城河。
远期愿景具备想象空间:Self-training(递归式自我提升)和Fully Self-Training代表了AI发展的终极形态之一,若能在下一代模型中验证数据/环境/Infra的自主化,将打开非线性的价值增长空间。
建议关注:智谱正处于"能力兑现"的早期加速阶段,短期需跟踪Cowork场景商业化进度与下一代基座模型表现,中长期需观察Self-training飞轮是否真正跑通。在全球AI竞赛中,智谱已证明中国模型公司可以通过成本效率、后训练深度和垂直场景渗透,走出一条差异化的商业化路径。
智谱26H1 业绩会全文
唐杰:
各位投资者、分析师,大家晚上好。非常感谢大家参加2026 年中期业绩会。下面我简要介绍智谱的基本情况、近期思考及未来技术布局。大模型已发展近 10 年。自去年起,智谱意识到大模型正从“对话”转向“做事”,并较早布局,重点加强模型的 Coding 能力。去年年中,我们发布了 GLM-4.5,这是首个在 Coding 能力上取得良好效果的模型。今年以来,我们陆续发布 GLM-5.0、5.1、5.2 和 5.3,这些模型均在同一基础上持续迭代。
首先,Scaling 是否意味着必须大幅增加参数?Scaling 是通向更高智能的关键路径,但其本质并非简单扩大参数规模。今年以来,我们在基座规模、后训练和任务环境方面均大幅加强。在扩大参数规模的同时,还需要提升模型的有效深度,例如通过 Loop Transformer 让模型在推理过程中思考得更深,我们近期也在推进相关工作。另一方面,后训练仍有很大提升空间。因此,我们在 GLM-5.3 上投入了大量工作,显著加强了后训练。
同时,Coding 包含多种不同任务。强化各类 Coding 任务,能够系统提升模型的整体能力。我们围绕不同任务环境开展了大量工作,使 GLM-5.3 的效果显著提升,达到 SOTA 水平和当前智能上界。
另一方面,模型不仅要能力强,还要让用户用得起、用得上。设计模型时,既要考虑模型规模和激活参数,也要考虑推理及基础设施效率,降低推理成本,才能让技术更广泛地普惠大众。
因此,在设计GLM-5 系列时,我们重点加强了推理能力。面对英伟达及多种国产芯片并存的算力环境,我们借助外部力量,并收购了一家推理技术公司,进一步强化推理能力,使 GLM-5.1、5.2 和 5.3 更易部署和使用。
目前模型用量较大,在OpenRouter 上的调用量一度位居第一。每次新模型发布后,MaaS 平台调用量基本都能实现成倍增长。以上是我们今年整体布局和进展的基本情况。
对于模型研发公司而言,核心仍是不断提升智能上界,这也回到智谱最本质的愿景。2019 年,我们为智谱确定了唯一愿景:让机器像人一样思考。直到今天,我们仍在探索智能上界。探索上界并非只训练模型,还要思考模型未来应具备怎样的智能、能够完成哪些事情。围绕下一阶段的布局,我们形成了多方面思考。
第一,今年初我们看到,Coding 已成为行业普遍认可的方向。我们进一步思考如何让模型在 Coding 基础上完成更多任务。围绕 GLM-5.1 和 5.2,我们提出 Long Horizon Task,希望模型执行更长程的任务;同时提出 Autonomous AI,即让模型能够自主完成一项任务。
具备上述能力后,模型还需要进一步发展。我们已经启动模型完全自训练的研究,希望模型能够自主学习预训练、中训练和后训练,并自主搭建Harness,使训练过程逐步实现自主化。
大家可能已经注意到,在近期的推理优化中,尤其是GLM-5.3 发布及国产芯片基础设施优化过程中,我们已使用 Infra Agent。由 GLM-5.3 驱动的 Infra Agent 能够自主修正国产芯片上的优化方案,显著提升效果。未来,我们将继续沿这一路径发展并增强相关能力。
最后,在推动AI 普惠、让更多人用得上的过程中,社会责任同样重要。模型发布和规模化使用需要完善的治理与安全机制。我们持续思考如何增强模型在社会治理、社会安全及伦理方面的能力,并已启动相关研究。我们也希望投资者和分析师提出更多建议、给予更多支持,共同探索 AGI 高地和 AI 普惠路径。
刘德兵:
接下来,我将对上半年的成果与思考作完整汇报。概括而言,如果去年我们的关键词是“智能上界”,今年上半年的关键词就是“能力兑现”。模型首次被证明不再只是工具,而是能够独立完成一项任务。收入结构随之发生变化,优秀模型的商业价值开始规模化兑现。
第一部分是公司在战略聚焦和模型发展方面的思考。首先,智能上界决定任务边界,任务价值决定商业空间。今年3 月的年度业绩会上,我们提出一个公式:AGI 商业价值 = 智能上界 × Token 消耗规模。智能上界决定模型能处理哪些任务、单位 Token 能创造多少用户价值;智能上界越高,模型就能处理价值密度更高的任务,每单位智能对应更多经济产出。Token 消耗规模反映智能被使用的广度和深度。同样一个 Token,用于闲聊或修复生产环境漏洞,产出可能相差几个数量级。因此,Token 落在何种价值密度的场景,取决于模型能够打开怎样的任务边界;任务边界每提升一级,市场空间就可能放大一个量级。
第二点思考是模型能力发展的五个阶段。我们认为,大模型能力演进并非几条并列的产品线,而是一条依次推进的阶梯:Chat、Coding、Agent、Cowork、Autonomous AI。Chat 交付一次性回答,Coding 交付可运行代码,Agent 交付执行完成的多步任务链,Cowork 交付可由专业人士复核的工作成果。
Autonomous AI 交付持续运行的能力。每向上一级,都存在具体的技术门槛;跨不过门槛,上一层商业模式就无法成立。从 Chat 到 Coding,门槛是结果可验证;从 Coding 到 Agent,门槛是长程规划与错误恢复;从 Agent 到 Cowork,门槛是可靠性达到专业人士愿意复核、无需推倒重做的水平;从 Cowork 到 Autonomous AI,门槛是模型能否自主判断结果是否正确。报告期内,公司重心处于 Coding 至 Cowork 之间。公司已在网络安全、法律、金融、教育等领域开展尝试,其中网络安全进展最快,其余方向仍处早期,尚未形成规模化收入。
公司模型在CyberGym 上取得 84.5% 的成绩,超过 WABO5 与 GPT-5.6 SOLO;在 ExploitGym 上完成 130 项任务,仅次于 WABO5 和 GPT-5.6。第三点是保持持续最优的模型迭代轨迹和 SOTA 水平。过去一年,行业对 SOTA 的理解正在被改写:短期榜单领先不再是最重要的,真正值得关注的是谁能以更快节奏、更优成本,持续将更强模型推向市场。单点冠军转瞬即逝,持续最优才是一条不断向上的轨迹。
GLM 系列在约 11 个月内完成六次迭代,智能指数从 32 提升至 60,单任务成本稳定在 0.2 美元档位。GLM-5.3 Flash 更以 0.045 美元的单任务成本进入智能成本前沿。其中,GLM-5 以 Coding 为入口,打开长程智能,能力重点由代码生成延伸至系统理解、任务规划、工具调用与工程交互,推动模型从 vibe coding 走向 agentic engineering。编程已成为公司收入的主要来源,Coding 中积累的长程任务能力也在网络安全等领域得到迁移验证。
GLM-5.2 是面向长程任务的旗舰模型,支持真正可用的一兆上下文,实测可承载项目级工程上下文,长程任务执行更稳定、工程规范遵循更可靠,开发场景成功率进一步提升,一次任务即可完成从需求到多端可部署产物的完整开发链路。GLM-5.3 是智谱最新旗舰模型,复杂软件工程和 Agent 任务能力全面进阶。它使用与 GLM-5.2 相同的基础模型,能力提升均来自后训练,在复杂编程与长程任务方面表现更为出色。GLM-5.3 训练进一步推进任务环境的规模化,使训练任务不再局限于传统编程题,而是更接近专家在真实工作中承担的完整专业工作单元。同架构、同总参数、同激活参数,仅扩大后训练规模,端到端完成率提升超过 50%。GLM-5.3 证明,Scaling 不只有参数这一项,训练是当前提升空间最大的因素。
如果说GLM-5.3 代表当前能力上界,GLM-5.3 Flash 则代表成本前沿。面向高频、大规模、成本敏感的调用,GLM-5.3 Flash 采用全新架构,专为降低成本设计,总参数 320B、激活参数 18B,融合稀疏注意力与线性注意力,价格为 GLM-5.2 的 1/10,基准测试与实际应用表现均优于 GLM-5.2。发布前,该模型以匿名模型 OX、Aux Offer 的身份在 OpenCode 和 OpenRouter 上接受真实调用检验;上线首日登顶 OpenRouter,并刷新单日 Token 用量纪录。6 天调用总量超过 62 万亿,带动平台整体调用量提升超过 20%。
第四是“国芯推国模”的进展。自年初起,我们将国产芯片纳入主力推理算力。GLM-5.3 Flash 是公司首次在超大规模真实流量中全面使用国产芯片集群提供服务的模型。芯片之间通过自研高带宽互联网络连接,整个推理引擎由 GLM-5.3 驱动的 Infer Agent 大幅加速,算子开发周期缩短一半。“模型优化系统、系统承载模型”的循环首次在公司内部跑通。
与同一硬件的初始基线相比,端到端服务性能提升3 倍。公司已实现 10 万卡级国产芯片的规模化、低成本推理,单位 Token 推理成本较年初下降 80%。在全球算力供给持续紧张的背景下,这条路径意味着我们已开始掌握自身的成本曲线。下面请肖磊介绍公司财务数据。
各位投资人朋友好。下面我介绍公司的财务业绩和业务发展情况。2026 年上半年,公司总收入达到 9.54 亿元人民币,折合 1.42 亿美元,同比增长接近 400%。比增速更值得关注的是收入构成的切换:开放平台及 API 业务收入为 8.25 亿元人民币,折合 1.23 亿美元,较去年上半年增长超过 27 倍,占总收入的比例由去年同期的 15.2%、去年年末的 26.3% 显著提升至 86.5%。目前,智谱主要营收已基本由开放平台及 API 业务贡献。近期发布的 GLM-5.2、5.3 和 5.3 Flash,推动开放平台及 API 业务实现历史性放量。
截至2026 年 8 月末,我们的 ARR 已达到 16 亿美元。该 ARR 按月度收入年化计算,即以 8 月收入乘以 12。海外前沿模型公司和行业内还有一种更激进的算法,即以最近一周数据乘以 52。考虑 GLM-5.3 的放量,若按该口径计算,最新 ARR 已超过 20 亿美元。相比 ARR 数字本身,其背后的驱动更为重要。今年以来,智谱收入实现了较为健康的量价齐升。截至 8 月末,MaaS 平台 Token 调用量较年初增长超过 40 倍,其中 CodingPlan 调用量增长超过 23 倍;API 平均定价提升约 101%。这表明平台收入的历史性放量主要由模型能力驱动,而非完全依赖价格弹性。受益于量价提升,业务毛利率也大幅改善:开放平台及 API 业务毛利率由去年上半年的 -0.4% 提升至今年上半年的 24.6%,同比提升 25 个百分点,较去年全年的 18.9% 提升约 6 个百分点。
研发方面,我们继续全力投入,因为模型领先是一切的前提。2026 年上半年,公司研发支出达到 21.3 亿元人民币,约合 3.17 亿美元;期内亏损约 20.72 亿元人民币,同比减少 12.1%。期内亏损率较去年上半年收窄 4.7 倍。经调整净亏损为 19.64 亿元,经调整亏损率较去年上半年收窄 3.5 倍。可以明显看到,在收入规模扩大的同时,单位经济仍在快速改善。
尤其值得关注的是,今年上半年经调整净亏损为19.64 亿元,低于研发投入。这表明继去年年报以来,业务贡献的毛利润在初步覆盖管理费用和销售费用后,已开始逐步反哺研发投入。
接下来是第三部分,我将从五个方面介绍财务数字背后的业务经营情况。第一,收入结构发生质变。2026 年上半年,开放平台及 API 业务收入占比达到 86.5%。这并非主动设计的结果,而是模型能力提升带来的自然演进。回顾公司业务发展历程,我们从两年前销售本地化部署模型,逐步转向 API 调用、订阅制套餐,再到今天销售端到端任务结果。随着模型智能水平提升,新的场景和业务形态被依次解锁。
随着模型能够独立完成的任务越来越完整,客户购买的内容越来越接近结果本身,收入计量单位也随之改变。回顾2025 年以前的第一阶段,公司主要发展本地化部署业务。彼时早期模型尚不足以独立完成一项完整工作,用户购买的是工具,工具需要集成、定制并交付到自有环境,同时还要满足数据安全、合规和自主可控要求。因此,本地化部署是当时企业采用大模型的自然起点。
2025 年初以后,公司逐步进入第二阶段,即 Coding 阶段。这一阶段的典型特征是模型从知识驱动走向任务驱动。编程能力提升推动了 API 和订阅制 CodingPlan 等产品快速增长。
在这一阶段,公司战略性收缩本地化部署模型的软件授权业务,转向持续提供可调用、可扩展、可量化的智能服务。今年以来,公司进入第三阶段,即Agentic 与 Cowork 阶段,业务由模型调用逐步走向任务交付。2026 年上半年,GLM 模型在 Agent 规划、工具调用和持续执行长程任务方面继续提升,业务也由 Coding 单点应用延伸至软件工程、网络安全、数据分析、复杂自动化等高价值场景。业务模式从销售调用量,进一步走向销售订阅和端到端任务结果。
面向未来,Cowork 正是公司正在打开的阶段。模型连接企业数据、工具和业务系统,并嵌入采购、财务、客服、研发、IT 运维等多个环节,已具备从理解需求到执行任务的基础。企业真实工作流又能反向成为模型学习的环境和数据。2026 年上半年报告期内,公司已在网络安全、法律、金融、教育等方向开展尝试。
目前网络安全领域进展最快,其他方向仍处早期,尚未形成规模化收入。将本地化部署、Coding 和 Cowork 三个阶段连起来看,核心逻辑是:模型每完成一次任务和能力跃迁,客户购买的内容就更接近最终经济价值和结果,公司收入结构也随之改写。以上是收入结构变化的根本原因。第二,Go-to-Market 策略进一步拓展。除模型在各类 Benchmark 上的得分外,行业越来越关注模型能否在智能和成本两个维度实现帕累托最优。2026 年上半年,公司继续深耕高价值任务场景,同时推出 GLM-5.3 Flash,希望证明前沿智能也能进入普惠场景。依托 10 万卡级以上国产芯片集群,公司已初步实现超大规模低成本推理。上月底,公司面向全量用户开放 CodingPlan 订阅,覆盖 Light、Pro、Max 和团队版本,这是国内较早以订阅制交付编程智能体能力的大模型服务之一。除通过 API 满足企业级需求外,我们也希望为中国开发者提供优质的订阅制编程套餐产品。从高价值任务到前沿智能与普惠场景并行,从企业级服务到 API 与 CodingPlan 并举,公司的 Go-to-Market 策略正向更深、更宽、更均衡的方向发展。
第三,我们首次详细介绍MaaS 平台的用户规模、使用深度和用户质量。截至 2026 年 8 月,平台注册用户数已超过 740 万,较年初增长 144%;付费日活用户数较年初增长 603%。从收入角度看,前十大用户本月日均调用量较年初增长 98 倍。这些数据层层递进,表明我们已构建中国最大的独立开发者平台之一,平台用户总量仍在大基数上快速增长。过去两个月,受 GLM-5.2、5.3 和 5.3 Flash 三款模型推动,用户数从 6 月底的 580 万增加 160 万,达到 740 万。
这表明,进入长程任务时代后,重度开发者用户无论在规模还是使用深度上,对平台的日均调用均远超此前vibe coding 阶段的真实工作流。同时,平台高质量用户群体持续扩大。截至 8 月末,按 ARR 口径计算,年化贡献超过 10 万、50 万、100 万、1,000 万、2,500 万和 2.5 亿美元的高质量用户群组,分别达到 115 个、25 个、37 个、8 个、2 个和 2 个。以上是关于用户规模、用户画像、使用深度和用户质量的情况。
第四,我们介绍一个新概念——算力乘数。该概念近年来受到行业广泛关注,反映大模型公司每投入 1 元算力所对应的开放平台及 API 收入,其中算力投入同时包括训练侧和推理侧。公司今年的算力乘数较去年上半年提升 14 倍,表明算力供给效率得到显著改善。
这条曲线的改善来自两方面:一是单位Token 承载的智能不断提高,单位任务消耗的 Token 和成本持续下降;二是每投入 1 元算力所获得的收入不断增加,意味着模型的自我造血能力持续增强。智能突破带来更大的 Token 调用量和商业回报,回报再投入算力和研发,进一步抬升模型智能上界,这一飞轮已经初步转动。
第五,安全能力与模型能力同步增长。模型能力要成为可依赖的服务,关键在于能否获得真实世界的信任。我们始终坚持开源开放与安全能力同步发展。一方面,公司通过开源模型权重、MaaS 平台、CodingPlan 和全球开发者网络,让模型进入尽可能多的真实环境;另一方面,通过权限控制、过程监督、风险评估、漏洞披露和外部验证,建立能力的可核查性。以上是公司财务业绩和业务发展情况。下面请智谱董事长刘德斌介绍未来展望。
2026 年上半年,我们验证了模型能够独立完成一项完整工作。下一步是让模型承担完整业务。围绕这一目标,我们形成了几点判断。第一,从模型任务看,模型正从长程任务向自治系统演进。当前前沿是数小时量级的工程任务,下一步将扩展至数天量级的完整交互,使模型在更长周期内保持目标一致,持续拆解任务、调用工具、与环境交互、修复错误并验证结果;同时从单一 Agent 走向多 Agent 分工协作,由模型承担完整业务流程,从辅助工作走向执行工作。这一步的门槛不完全在智能本身,更在于可靠性和可审计性。模型需要在无人逐步检查的条件下工作,同时留下可复核的痕迹。
第二,从能力演进看,Scaling 从未停止,仍是通向更高智能的主要路径。没有改变的是路径,改变的是 Scaling 的对象。当前决定模型上限的是四个因素的组合:基座规模、有效深度、训练深度和任务环境。四者的边际收益不同,并会随阶段轮换。公司的资源分配,就是在不同阶段判断哪个因素的当前回报最高。
GLM-5.3 证明,训练深度是当前提升空间最大的因素。后训练做到极致后,下一阶段的增长必须回到基座。GLM-5.3 Flash 已通过新一代架构和 30 TG 多模态语料验证效率。下一代基座模型已在训练,方向包括更大的有效规模、更长的原生上下文,以及原生多模态统一建模。
第三,在系统层面实现self-training。更深层的变化发生在训练系统内部,数据、环境和基础设施都出现了由 AI 接管的早期迹象。数据开始自产,model vs. model 的自我对弈管线,使数据质量上限不再取决于人类标注速度,而取决于模型自身的验证能力。环境开始制造:研究智能体采集任务模式,裁判智能体逐一试做,验证器与环境自动合成,逐步成为流水线上的标准产品。基础设施开始自我优化,推理系统优化本质上是代码工程任务,而这正是模型最擅长的能力领域。
这三条线指向同一终局:模型参与自身改进,形成递归式自我提升。这就是我们的技术愿景——self-training。下一代 GLM 将在上一代 GLM 搭建的环境中实现自训练。第四,边界与治理。能力越强,越需要将评估和判断交给外部。对模型能力的评估和风险判断,最终必须由人裁量,并引入外部机构独立评估。2026 年上半年,我们已在网络安全领域开展相关实践。最敏感的能力实行受控开放;开源前,由第三方专业团队独立评估;漏洞通过国家漏洞库完成责任披露;基准分数由公司报告。风险判断交给外部团队,这一分工不会因能力提升而改变,只会随能力上移而加强。
最后,我想用一句话总结今天所有数字:模型能力的代际水平,是公司所有产品与商业逻辑的起点。从GLM 预训练架构到悟道系列,再到今天的 GLM-5 系列,7 年来我们始终专注于一件事——训练更强的模型。收入的每一次快速增长,都发生在模型能力提升、新任务场景被解锁之后,而非之前。先有能力,再有生意。2026 年上半年收入结构的翻转和量价齐升,已经验证了这套逻辑。接下来,将由更大的用户规模、商业规模和全球影响力继续验证。路还长,但方向笃定。谢谢大家。
Q:如何看待智谱在 Coding 能力上的领先,真正的长期壁垒是什么?
A:任何单点领先都有时限,Coding benchmark 第一可能以周或月为单位被追平。比某一次榜单排名更重要的是持续迭代能力。
过去约11 个月,GLM 模型家族从 4.6、4.7、5.1、5.2 到 5.3 连续完成多代迭代,能力曲线持续上升,同时单位任务成本保持在相对健康的水平。
长期壁垒不是在每个benchmark 上永久领先,而是保持更快的模型迭代、更高的真实任务完成率、更低的单位智能成本,并持续进入更高价值的客户工作流。
Q:为什么选择 Coding 作为模型能力突破的关键起点?
A:Coding 并非只被视作快速商业化的产品线,而是向 Agent、long-horizon task、复杂协同工作及 Fully Self-Training 演进的技术卡点。
复杂Coding Agent 需要同时完成需求理解、任务拆解、代码阅读、工具调用、代码修改、测试运行、重新规划和结果验证,能够系统训练多步规划、错误恢复和自我修正。
代码能否运行、测试是否通过、性能是否改善、bug 是否修复都可客观验证,因此 Coding 提供了规模化、自动化、低成本的强化学习反馈环境。
GLM-5.3 的训练环境已从传统 coding exercise 扩展到真实工程任务,部分任务工作量相当于资深工程师连续工作数天。
Q:Coding 能力如何迁移到网络安全及其他专业场景?
A:网络安全需要理解代码、发现异常、调用工具验证、建立多阶段攻击与防御流程,并根据环境反馈调整方案,底层能力与复杂 Coding Agent 高度一致。
CyberGym 上,GLM-5.2 得分约 77.2,GLM-5.3 提升至 84.5;ExploitBench 从约 24.4 提升到 54.4,越接近完整 exploitation chain、越需要长程规划的任务,提升越明显。
自GLM-5.2 以来,与多家国内安全团队在真实代码库中合作,累计发现并经过专家筛选去重的漏洞约 2,436 个,其中超过 1,000 个为高危漏洞,覆盖 269 个项目。
下一步会把Coding 训练出的长程规划、工具调用和错误恢复能力继续迁移到数据分析、复杂自动化、法律、金融等高价值专业工作。
Q:智谱选择 Cowork 场景的标准是什么?
A:Cowork 不是简单的日常办公辅助,而是对专业领域真实、复杂工作流的承担或替代。
场景选择有三项标准:任务具备足够高的智力门槛;结果能够被有效验证;完成任务能创造足够高的经济价值。
网络安全是当前验证最清晰的方向。法律、金融、数据分析等也在尝试,但由于可靠性门槛和验证机制不同,商业化节奏会有差异。
如果每一代模型都能完成更长、更完整、更专业的工作,Coding 就会成为一种 meta ability,公司可服务的高价值任务边界也会持续扩张。
Q:当前算力扩张进度和算力资源结构如何?
A:今年以来算力持续按照健康节奏扩张,训练侧和推理侧都在增加投入。算力来源包括自有集群、算力租赁和算力服务采购,用途覆盖预训练、mid-training、post-training 和生产推理。
不同代际、不同架构芯片形成多元异构环境,训练效率和推理吞吐差异较大,简单统计卡数量已经无法准确反映算力供给和Infra 能力。
内部更关注有效算力,即已经安装、能够稳定调度、可以长期运行,并最终转化为模型训练进度或可计费token 的算力。
衡量大模型公司算力能力的核心,不是拥有多少张卡,而是资源能够支持多快的模型迭代,以及多大规模的商业化token 供给。
Q:国产芯片在智谱推理业务中的使用规模和表现如何?
A:截至上半年,已经在约 10 万卡规模上实现国产芯片的规模化低成本推理,推理供给不会把进口卡或国内卡的单一渠道作为唯一路径。
GLM-5.3 Flash 匿名上线时,后台全面使用国产芯片集群提供服务。约 6 天内承接了约 60 万亿 token 调用,在 OpenRouter、OpenCode 等平台的历史级大流量下保持了良好服务。
国产加速卡和推理卡能否运行已得到验证,下一阶段的重点转向经济性:如何在显存容量、带宽、长上下文等约束下提高单位硬件产出的有效token。
Q:Infra 优化对国产芯片推理效率带来了多大提升?
A:公司从半年前开始执行 all in Infra 策略,并针对 GLM-5.3 重做推理引擎和服务栈。优化涵盖 encode/decode、prefill-decode 分离、量化、layer split、缓存与通信等环节。
在相同国产硬件和算力基础上,整体端到端服务性能相比初始基线提升约3 倍。
面对有限和复杂的算力供给,通过模型与Infra 协同优化提高效率,比单纯扩张硬件来源更加本质。下一阶段主要矛盾是把每一单位物理算力转化为更多智能、有效 token 和商业价值。
Q:训练侧算力面临什么结构性问题,未来会如何改善?
A:前沿模型训练不仅需要算力数量,更需要大规模同构集群的稳定性、网络通信、软件栈和长期运行能力。
国内现阶段仍以异构算力为主,先进国产卡尚未完全进入大规模放量阶段,形成一定结构性错配。
未来约3-6 个月,先进国产芯片厂商可能迎来放量,异构并行环境有望明显改善。
基座模型训练已经推进,算力配置会优先保障关键训练窗口,不会因为推理需求快速放量而把所有资源都转向推理。
Q:模型层是否面临商品化风险,智谱如何建立定价权?
A:单点 SOTA 无法形成长期定价权,公开 benchmark 和短任务能力会逐渐趋同;但长时间、可执行、可验证的真实任务会放大模型之间的差异。
过去约11 个月,GLM 在 Artificial Analysis 的智能指数从 32 提升到 60,旗舰模型单任务成本基本维持在约 0.2 美元;GLM-5.3 Flash 进一步降至约 0.045 美元。
定价权取决于token 能完成什么任务。100 万 token 用于闲聊与用于完成工程项目、修复生产系统漏洞,对客户创造的价值完全不同。模型从 Coding 走向 Agent、Cowork 后,客户购买的会逐渐从 token 转向任务结果。
模型进入客户代码库、工具链、内部数据和工作流程后,客户会围绕其积累prompt、agent workflow、权限体系、评测标准和工程集成,切换成本不再只是 API 单价。
Q:商业数据是否已经验证能力提升可以支撑提价?
A:上半年 API 平均售价提高约 101%,同时 token 调用量仍大幅增加;按收入计,前十大客户的日均调用量较年初增长约 98 倍。
价格提高而核心客户使用更深,说明客户并非只因模型便宜而使用,而是在能力提升后愿意把更多真实任务交给模型,并为更强能力付费。
行业未来可能形成两条价格曲线:同等智能水平的价格持续下降;能够打开新任务边界、显著提升成功率的frontier model 仍可能获得溢价甚至进一步提价。
Q:海外业务目前处于什么阶段,未来如何拓展?
A:从 2025 年开始已经形成一定规模的海外业务。早期以本地化部署和主权大模型项目为主,马来西亚的 Matrix 大模型项目是较早的出海尝试。
随着业务形态变化,海外业务重心已转向开放平台和API。GLM-5.3 代表较高阶智能,GLM-5.3 Flash 代表普惠和高性价比,在高价值任务层和普惠层分别占据生态位。
正在积极推进与海外CSP 平台合作,未来会通过开源模型、本地托管、收入分成等方式拓展海外市场,预计未来 1-2 个月可能披露进一步进展。
中国模型与海外最头部模型仍有差距,但综合能力和成本形成的帕累托最优,能够成为海外竞争的重要切入点。
Q:下一代 GLM 模型最核心的提升方向是什么?
A:Scaling 从未停止,目标仍是提高智能上界。过去曾投入多模态、图像和视频生成研究,但这些方向对智能上限提升的帮助有限,因此重心转向文本,以及文本与多模态相互增强的模型形态。
模型能力正从回答知识问题转向完成事情,研究重心也从基础问答逐步转向Coding 和 Cowork。下一代模型仍会沿这一方向推进。
基座模型会继续扩大,以更好存储和表示知识;同时通过较小激活结合loop 等方式增加推理深度,避免几 T 规模模型因激活参数过大而导致速度过慢、成本过高。
除scaling 基座外,post-training 会显著加强,通过技术和工程方法弥补国内算力与 OpenAI、Anthropic 等海外厂商的差距。
Q:数据环境和后训练为什么是 GLM-5.3 提升的重要来源?
A:智谱在 2022 年 ChatGPT 发布前后即成立了数百人的数据标注团队,长期投入数据和训练环境建设。
GLM-5.3 相比 GLM-5.2 提升明显,一个重要原因是数据环境规模扩大了数十倍。未来还会继续 scaling 数据和环境。
互联网新增文本数据逐渐减少,合成数据占比提高,因此除了扩大基座参数,更需要建设可验证的数据环境和真实任务环境,让模型在post-training 中持续获得有效反馈。
Q:GLM-6.0 所设想的 Fully Self-Training 是什么?
A:Fully Self-Training 对应具有自进化能力的模型,在海外也常被称为 RSI。目标是让模型从 pre-training、mid-training 到 post-training 都能更多自主训练和自我演进。
最大挑战不是简单把模型训大或持续训练,而是让模型能够判断自己、知道何时停止,并在出错时自主纠正。
Fully Self-Training 会成为未来模型的重要研究方向,同时会把伦理和社会治理纳入模型演进过程。
Q:为什么当前在参数规模上相对克制?
A:模型规模选择需要综合资源、模型目标和用户何时能真正使用。国内可用训练数据规模通常约为 30-50T token,在这一数据规模下,按照 scaling law 盲目训练特别大的模型,边际收益未必足够高。
国内算力有限,且mid-training 和 post-training 的潜力尚未完全释放,简单扩大参数并非当前最关键的投入方向。
GLM-5.3 的 7450 亿参数基座在年初已完成训练,并从一开始就规划复用半年以上,在同一基座上依次推进 5.1、5.2、5.3,以及相应的 SFT、mid-training 和 post-training 环境建设。
基本思路是把每个基座模型的能力释放到最大,同时把推理成本优化到用户真正能够大规模使用的水平,而不是只追求一个大但无法部署的模型。
Q:下一代基座模型和推理部署如何规划?
A:下一代大基座模型已经在推进,具体参数尚未披露;在新基座之上还会系统规划 mid-training 和 post-training。
推理预研已经提前开始,目标是下一代模型发布第一天即可支持用户满量使用,而不是发布后再长期等待工程适配。
模型开源后能够被企业直接安装和使用,同时公司自身也能通过低推理成本支撑大规模调用,仍是下一代模型的重要设计约束。

