大模型能力的提升,过去主要依赖两条路径:一是遵循 Scaling Law 不断扩大参数量,导致算力成本飙升;二是借鉴 o1 等思考模型,通过延长思维链和增加推理时间来换取效果。
除了堆叠参数和拉长思维链,是否存在第三条路?微信 WeLM 团队给出了全新答案:将额外算力折叠进序列内部,让模型在 token 之间完成隐式思考。这种方法被称为 Hidden Decoding(隐式序列缩放)。
WeLM 团队已成功将该技术推向前沿规模:从 3 月的 80B 参数升级至目前的 617B MoE 架构。实测显示,增量续训仅消耗完整训练量的 5.3%,且在 9 项核心评测中全面超越自回归基线。
把思考折叠进序列:WeLM 617B MoE 的隐式 Scaling 路径
7 月 14 日,微信 WeLM 团队发布 Hidden Decoding 系列第二篇技术博客,首次展示了总参数达 617B、性能比肩开源头部水平的模型进展。
早在今年 3 月,WeLM 团队便发表了该系列首篇博客,当时 Hidden Decoding 仅在 80B 规模上完成了初步验证。四个月间,团队不仅夯实了方法论,更成功将其扩展至 600B+ 量级。
该技术的核心在于:将每个 token 在序列维度上展开为多条并行的“流”,利用同一套 Transformer 权重在一次前向传播中完成多步隐式推理,且仅在最后一条流上计算损失。换言之,模型在输出下一个 token 前,已在序列内部完成了一段不可见的“深思”。
如果说过去一年的主线是“做大参数”和“拉长思维链”,Hidden Decoding 则开辟了第三条路径:在不增加参数的前提下,通过优化算力组织方式,将额外计算能力藏入序列本身,实现内部多步推理。
参数与思维链之后,第三条路指向隐式序列
当前大模型社区的努力方向主要分为两类:一是冲击万亿参数规模;二是通过后训练阶段的强化学习和长思维链挖掘推理潜力。然而,这两条路径均隐含一个前提——需要“更多”的资源(参数或高质量数据)。
Hidden Decoding 绕开了这一限制,回归预训练与继续预训练阶段,探索如何在同等权重和数据下,通过更聪明的算力组织逼出更多能力。
核心问题:同一套权重、同一批数据,能否通过更高效的算力组织,释放更强能力?
此类思路此前已有尝试,如循环模型或序列扩展方案,但往往受限于串行计算无法并行,或注意力机制随序列长度平方级膨胀,导致在大规模模型上难以落地。WeLM 此次突破,正是在 100B+ MoE 体量上重新打通了这条路径。
先认识一下 WeLM:微信大模型的四代演进
WeLM 是微信 AI 团队研发的通用大语言模型系列,承载微信在人工智能领域的核心技术战略。自 2022 年亮相以来,WeLM 已迭代四代,形成了从训练体系搭建、效率质量创新,到大规模 Scaling 突破及推理范式创新的完整技术版图。
值得注意的是,WeLM 并非仅停留在实验室指标。当前处于灰度测试阶段的微信 AI 助手“小微”,其核心能力即由 WeLM 提供。依托微信庞大的用户生态,WeLM 已在真实场景、海量流量及复杂任务中经受住了考验。
Hidden Decoding:把思考折叠进序列
Hidden Decoding 的实现可概括为三个步骤:
- 序列扩展:给定输入序列和 n 份词表嵌入,将第 i 个 token 的第 k 条“流”表征映射到物理位置 (i−1)n+k,构建长度为 nL 的扩展序列;
- 统一前向:扩展序列在标准因果注意力和连续位置编码下,送入同一个 Transformer,无需新增主干参数;
- 单流监督:训练时仅在每个 token 的最后一条流上计算预测损失,前 n−1 条流不接收直接监督。
前面的流如同“打草稿”,逐步精炼表征并保留更宽的候选集合,最终由最后一条流收敛至预测结果。
此前团队已在 6B、8B、80B 模型上验证了该方法的有效性,此次目标则是将其推进至真正的前沿规模。
关键工程:让扩展在 100B+ 体量上可训
将序列从 L 扩展至 nL,非注意力计算呈线性增长,但稠密注意力复杂度会按序列长度平方膨胀(如 n=4 时膨胀 16 倍),导致大模型无法训练。
团队提出了Stream-Factorized Attention(流因子化注意力)解决方案:
- 流内注意力层:大多数层仅关注同一条流内的更早位置;
- 跨流注意力层:少数层启用跨流混合,沿用基座原本的注意力形态(滑动窗口或全注意力)。
通过在基座已有的局部注意力层和少量全注意力层上启用跨流功能,团队将新增注意力成本从平方级压降至接近线性的 n 倍。此外,利用 WeLM 主干既有的 KV-mirror 设计(后段层复用前段层隐状态构造键值缓存),进一步加速训练。在 80B、32k 设置下,单步时间从 15 秒降至 12 秒,提升约 20%。
结果:全面超越基线
在保持其他条件一致的情况下,团队对基座模型进行了对比测试,并使用同一套短指令微调配方适配(不涉及强化学习)。结果显示,Hidden Decoding 在两个规模上均实现全面提升:
- 80B 模型平均提升约 0.99 个百分点;
- 617B 模型平均提升约 1.03 个百分点。
显著提升主要集中在 SuperGPQA、MMLU-Pro 等高难度推理与知识任务上。
成本:近线性的训练开销,且无需重跑完整预训练
实测数据显示,当 n=4 时,有效序列在 80B 模型上的耗时约为单 batch 时间的 5.1 倍,在 617B 模型上为 4.4 倍,接近线性参考值,远低于稠密注意力的 16 倍膨胀。
更重要的是,Hidden Decoding 支持在已有自回归基座 Checkpoint 上进行增量续训(CPT),无需从零开始。
推理吞吐:并行计算,小 Batch 下反而有优势
与串行执行的循环模型不同,Hidden Decoding 的额外计算是并行的。它将计算摊派到 n 条流上,一次前向即可完成处理。
实测吞吐矩阵表明:
- 大 Batch 场景:解码受计算限制,额外计算会略微降低吞吐;
- 小 Batch 场景:解码受显存带宽限制,大量算力闲置。并行流恰好利用这些空闲算力,相对基线损失更小,效率更高。
这意味着在实际在线服务中,Hidden Decoding 的推理成本并非简单线性增长,而是与 Batch Size 和序列长度分布强相关。
探针:折叠进去的思考,究竟在算什么
Hidden Decoding 仅训练最后一条流,前序流零监督。消融实验与探针分析揭示了其内在机制:
注意力组合消融:即使只在少数层(如 1 层或 4 层)启用全跨流注意力,也能恢复大部分收益,证明流因子化注意力能在保证准确率的同时维持低成本。
键值缓存消融:为不同流保留独立状态优于共享状态,证实独立的中间状态对性能提升至关重要。
流与语言模型头探针:在 8B 基座上的实验发现:
- 同一 token 的各流在 Transformer 中间层显著分化,临近输出层才部分靠拢,且最终流对其他流分配了可观的注意力,形成了从中间流到预测流的读取通路;
- 中间流的最优预测常与最终流不同(最大差异率约 63%),且不确定性更高。这说明在最终收敛前,中间流保留了更宽的候选分布。
结论明确:中间流在最终预测收敛前,充当了潜空间计算状态,保留并精炼了更宽的候选集合。这是 Hidden Decoding 区别于简单“加长序列”或“多目标预测”的关键。
展望:更强的基座,以及与强化学习的结合
博客透露,采用更高质量、更大规模数据进行后训练后,80B 与 617B 的自回归基座本身已展现出更高的基准成绩。Hidden Decoding 是在此扎实基座之上的进一步增益。
未来,团队计划在更强的基线上继续验证该方法的增益,并探索其与强化学习的深度融合。
写在最后
回顾 WeLM 团队近期的技术发布,一条清晰的技术路线逐渐浮现:
- 通过构建高效稀疏 MoE 模型,在同等智能下压低资源消耗,让智能服务更多用户;
- 通过 Hidden Decoding 创新推理范式,在同等参数下推高智能上限,用有限资源解决更难问题。
这一系列探索围绕“极致的资源效率”展开。对于面对超大规模真实用户与复杂任务的微信团队而言,极致的资源效率不仅是约束,更是通往更高智能的另一条路径。
参考资料:
博客原文:https://welm.weixin.qq.com/posts/hidden_decoding_at_scale/
首篇博客:https://welm.weixin.qq.com/posts/hidden_decoding/
论文 PDF:https://arxiv.org/abs/2607.08186
GitHub 仓库:https://github.com/Tencent/Sequential-Hidden-Decoding

