大数跨境

深度|腾讯AI的双线战争:混元之外,微信WeLM用四年证明了另一种可能

深度|腾讯AI的双线战争:混元之外,微信WeLM用四年证明了另一种可能 Z Finance
2026-07-14
54
导读:豆包之鉴,微信之师

7 月 6 日,腾讯混元 Hy3 正式版发布。同日,微信 AI 团队在 GitHub 发布了《Hidden Decoding at Scale》正式论文,WeLM 技术博客同步更新。此外,WeLM 官方技术团队开设小红书账号,开始对外宣传其技术成果。

这一系列动作的导火索可追溯至数月前。据媒体报道,2026 年腾讯年会上,微信高层公开表态希望自主训练大模型,并争取集团更多 GPU 支持。

在腾讯集团层面,混元是无可争议的“正规军”,由前 OpenAI 研究员姚顺雨统筹,AI Lab 整体并入,数百亿研发投入押注于此。而在此主线之外,微信事业群也在悄然发力,其核心项目名为 WeLM。

ChatGPT 更早的“微信造”

WeLM 的诞生时间远超外界预期。2022 年 10 月,即 OpenAI GPT-3.5 尚未发布、ChatGPT 引爆全球前一个月,WeLM 首个版本已悄然上线。当时微信 AI 团队低调发布了 10B 参数模型论文,随后三年该项目处于沉寂状态,实则一直在内部迭代。

2026 年 1 月至 7 月,微信 AI 团队通过四篇技术博客,完整展示了 WeLM 的技术路径与野心。

第一篇:以适度资源构建高效稀疏 MoE 模型

2026 年 1 月发布的《以适度资源构建高效稀疏 MoE 模型》指出,团队在不足 14T tokens 的语料上,训练出了 80B 总参数、单次仅激活 3B 参数的 MoE 模型,性能极具竞争力。相比同级别模型通常消耗的数十万亿 token,WeLM 用不到行业平均三分之一的数据实现了突破。

论文详细介绍了 WeLM-V4 架构,其中两项原创设计尤为关键:

KV-Mirror 技术:允许浅层与深层共享 hidden states 以生成 KV activation,显著降低预填充阶段的推理成本,特别适配微信长上下文场景(如群聊、朋友圈)。

Multi-Token Prediction(MTP)层:在模型顶层添加 MoE 作为 MTP 层,支持投机解码(speculative decoding),通过一次预测多个 token 提升响应速度

此外,通过深度上扩展(Depth Up-Scaling)技术获得的 130B 变体,在 GPQA-Bench 和 Web-MMLU 等基准测试中均有显著提升。

第二篇:初探 WeLM-258B MoE 模型后训练

同年 1 月发布的第二篇论文《初探 WeLM-258B MoE 模型后训练》,披露了完整的后训练流程,包含冷启动(SFT)与强化学习(RL)两个阶段。针对 RL 训练中的稳定性难题,团队提出了两项关键技术:

推出校正(IcePop):通过双向截断与动态掩码机制,校正训练与推理的概率分布偏差。

熵控制策略(Clip-Cov):限制高协方差 token 的梯度更新,防止模型过早陷入“过度自信”。

评测数据显示,WeLM-258B 在 MATH、代码评测及多语言编程等多个维度上超越 DeepSeek-V3.1,中文评测亦处于第一梯队。

第三篇:Hidden Decoding 在预训练中扩展序列长度

2026 年 3 月发布的《Hidden Decoding:在预训练中扩展序列长度》最具原创性。针对主流显式推理(CoT)依赖串行生成导致延迟高的问题,WeLM 提出了 Hidden Decoding 新范式。

其核心思想是在不增加 Transformer 主体参数的前提下,复制多份 Vocab Embedding 将序列长度扩展 n 倍。模型在连续的潜空间(hidden states)中进行高密度“思考”,再将结果折叠输出,从而换取更快的推理速度。

实验表明,该路线在 80B 规模下效果显著,BBH、MMLU 及 MATH 得分大幅提升,且展现出惊人的文学创作能力。相关代码与模型已在 Hugging Face 和 GitHub 开源。

第四篇:Hidden Decoding at Scale 面向前沿大模型的潜空间计算扩展

2026 年 7 月发布的最新论文《Hidden Decoding at Scale》验证了该方法在超大模型上的可行性。团队将 Hidden Decoding 推进至 100B+ MoE 规模,训练出 WeLM-HD4-80B 与 WeLM-HD4-617B 模型,全面超越自回归基线。

关键的工程创新在于Stream-Factorized Attention,通过将注意力开销从 O(n²) 降至接近线性,使得该技术在超大规模模型上具备落地可能。评测结果显示,其在 FrontierMath、PHYBench 等硬核基准上均有显著提升。

值得注意的是,该论文发表时间恰逢混元 Hy3 发布,两个团队在同一周展示了各自的最硬成果,这并非巧合,而是一种战略表态。

赛马再现,但这次不一样

WeLM 与混元的并行,构成了腾讯内部微妙的双线作战格局。混元隶属技术工程事业群(TEG),向总裁刘炽平汇报;WeLM 则隶属微信事业群(WXG)。两条汇报线互不交叉,算力与基础设施各自独立。

这与 2010 年手机 QQ 与微信的赛马有本质区别:移动互联网时代比拼的是产品体验,试错成本低;而 AI 大模型高度依赖统一算力集群与技术标准,双轨并行意味着巨大的资源重复消耗。高盛研报曾直指痛点,担忧两套体系引发资源浪费且协同未知。

更微妙的信号在于模型选用。目前微信“小微”采用"WeLM 主模型+DeepSeek 兜底”的混合架构,并未直接选用混元。这背后既有商业考量,也有组织原因。

商业上,免费 ToC 应用的算力成本极高。微信拥有 14 亿月活用户,若全量部署大参数模型,每日亏损可能达数亿元。WeLM 的架构设计正是解题关键:80B 总参数保证能力上限,3B 激活参数压低单次推理成本。每次交互仅动用不到 4% 的“脑细胞”,足以应对发消息、查记录等高频轻量场景;而在需要深度思考时,系统可切换至 DeepSeek 或混元。

WeLM 的架构设计就是这道算术题的答案:80B 总参数保证能力上限,3B 激活参数压低单次推理成本。每次用户提问,模型只动用不到 4% 的"脑细胞"。这意味着 WeLM 不适合复杂推理,但发消息、点外卖、查记录这些高频轻量交互,绰绰有余。但小微的产品设计里留了一条清晰的"逃生通道":轻量交互走 WeLM,需要深度思考时切 DeepSeek,切混元也行。

组织上,微信数据被视为红线。张小龙不会允许一个无法完全掌控的模型处理用户对话内容。混元虽为腾讯自研,但其训练数据来源、权重管理及服务部署均不在 WXG 掌控范围内。而 WeLM 实现了从训练到推理的全链路自控。

这不是简单的技术选型,而是主权问题。

克制本身就是一种力量

理解 WeLM 的存在,必须回归张小龙的产品哲学。微信十五年来坚持工具属性优先、“用完即走”,不制造信息焦虑。这与 AI 天然的“侵略性”形成张力。

小微的设计体现了这种克制:入口隐蔽,不主动打扰,不随意读取群聊记录。WeLM 的技术路线同样如此:不做通用对话或创意写作,而是专注于理解微信生态内的用户意图,调度服务能力。

灰度测试显示,小微在小程序模拟操作外的内容生成几乎无需等待。总结朋友圈、调用小程序、查聊天记录等看似“不够 AI"的功能,恰恰是 14 亿用户最高频的需求。

正如内部人士所言:“混元想做一个能回答宇宙终极问题的 AI,WeLM 只想帮你点好一杯奶茶,然后让你该干嘛干嘛去。”

两条路线,一个终点

2026 年 7 月 6 日,混元 Hy3 与 WeLM 最新论文同日发布。乐观来看,两者正形成互补:混元负责对外输出通用能力,WeLM 承载微信生态专用场景。悲观来看,整合尚未真正开始,WeLM 的团队、算力与数据体系依然独立。

或许 WeLM 与混元最终不会合并为一个模型,但它们都必须证明自己是不可或缺的一部分。在腾讯的 AI 叙事中,没有理所当然的主角。微信的 14 亿用户也不会容忍一个平庸的 AI 助手。

WeLM 用了四年时间证明自己不输于混元,接下来的挑战更为严峻:它是否足够优秀,来定义下一个十年的微信?

【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 863
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读84.9k
粉丝0
内容863