(文/汤普济 编辑/吕栋)
8 月 19 日,智谱联合创始人、首席科学家唐杰在 X 平台发表观点,指出大模型行业的 Scaling Law(尺度定律)正迎来关键修正。过去行业普遍将模型扩展等同于单纯增加参数量,而当前这一思路已被重新审视。
参数规模虽仍具价值,但大模型的后续演进不能仅依赖于此。训练数据质量、后训练策略、推理计算效率以及模型上线后的运营成本,均需纳入算力分配的核心考量。
市场数据显示,自今年 6 月下旬至今,智谱股价跌幅已超 60%,目前市值约为 4700 亿港元。
从参数扩张到多维优化:智谱 GLM 系列的演进路径
今年推出 GLM-5 时,智谱曾经历一轮显著的参数扩张:GLM-4.5 拥有 355B 总参数和 32B 激活参数,而至 GLM-5,总参数跃升至 744B,激活参数达 40B,预训练数据也从 23 万亿 Token 增至 28.5 万亿 Token。随后的 GLM-5.1 和 GLM-5.2 均延续了这一 744B-A40B 的规模架构。
然而,到了 GLM-5.3 版本,智谱并未继续堆叠参数,而是调整了资源投向。据唐杰介绍,GLM-5.3 与前一版本在基础模型、架构及参数量上保持一致,但投入约一个月时间专注于扩大长程任务环境和强化学习训练。官方报告显示,此举使 GLM-5.3 在内部 Z.ai Code Bench 上的表现较 GLM-5.2 提升约 50%。
Scaling Law 的认知修正:从“唯参数论”到均衡增长
这一策略调整折射出人工智能行业对 Scaling Law 认知的深化。唐杰认为,业界曾集中追逐万亿参数模型,事后证明这是一段共同经历并折返的弯路。
回顾历史,2020 年的研究曾引导行业相信,随着计算资源增加,参数规模的增长速度应快于训练数据。受此影响,GPT-3、Gopher 和 MT-NLG 等模型纷纷向数千亿乃至万亿参数迈进。
转折点出现在 2022 年,DeepMind 发布 Chinchilla 研究报告。该研究通过对约 400 个模型的实验发现,在固定计算预算下,参数量和训练数据应保持均衡增长,而非一味扩大模型。最终,70B 参数的 Chinchilla 在多项指标上超越了 280B 参数的 Gopher,促使行业重新审视对“大参数”的盲目追求。
推理成本与 MoE 架构:重塑算力分配逻辑
业界对 Scaling Law 的探索并未止步于训练阶段。随着模型大规模落地应用,推理成本在模型全生命周期中的占比日益凸显。在部分高频场景下,利用更多数据将较小模型训练得更加充分,往往比继续扩大模型规模更具性价比。Llama 2 7B、Gemma 2 9B 等模型的成功便印证了这一思路。
此外,MoE(混合专家)架构的普及进一步改变了参数规模的定义。模型虽可拥有数千亿甚至更高的总参数,但每个 Token 仅激活其中一部分专家网络,使得总参数量与实际激活参数量不再等同。例如,DeepSeek-V3 总参数达 671B,但每个 Token 仅激活 37B 参数。
能力拆解与未来方向:调节发展的“多个旋钮”
唐杰将模型能力拆解为“知识容量”和“推理能力”两个维度。他认为,扩大总参数更有利于容纳知识和长尾信息,而复杂推理任务则更依赖实际激活的计算量、训练数据深度及推理过程。两者未必需要遵循同一条 Scaling 路径。
针对 GLM-5.3 的策略,唐杰将其比作调节多个“旋钮”。此次智谱选择聚焦“后训练”旋钮,是因为该环节仍有巨大提升空间,但这并不意味着参数规模、预训练数据和单次前向计算不再重要。未来,智谱仍可能根据需求重新调整中期训练、预训练等其他“旋钮”。
这种多维度的探索已成为行业共识。今年 2 月,阿里发布 Qwen3-Coder-Next 时明确表示,相比单纯扩大参数,该模型更侧重 Agent 任务和训练反馈;同年 6 月的 Qwen-AgentWorld 则进一步扩大了模型训练所使用的交互环境。
学界也在积极寻找新规律。今年 ICLR 和 ACL 会议均出现了专门研究强化学习 Scaling 的工作,探讨在增加 RL 训练数据和算力后,模型能力是否能像预训练一样呈规律性增长。现有研究表明,更大模型在 RL 训练中仍具备更高的数据和计算效率,但强化学习本身也存在收益逐渐饱和的趋势,参数的重要性并未完全消解。

