大数跨境

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠? AI科技评论
2026-08-07
5
导读:张一鸣要的是,下一轮竞争中,Seed模型能力跻身世界第一梯队
张一鸣的战略定力:拒绝蒸馏,誓将 Seed 模型推向世界第一梯队

作者丨高允毅

编辑丨岑峰

近日,The Information 披露,在两周前的 Seed 全员会上,张一鸣罕见发声,明确拒绝以“蒸馏”手段追赶前沿大语言模型。他态度坚决:“字节跳动应该愿意为了长远目标牺牲一些短期利益。”

在最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max、阿里 Qwen 3.8 Max 等中国模型已占据全球前十近半席位。反观字节 Seed 2.1 Pro,仅排在第 21 位,表现远低于其他国内同行。

论资金,字节年利润位居互联网头部;论人才,Seed 团队汇聚顶尖算法专家;论算力,数万张 GPU 集群正在全国铺开;论数据,抖音与 TikTok 坐拥全球最大的原生内容池。

样样不缺的字节,为何在大模型榜单上暂时落后?据内部透露,不愿采用“蒸馏”捷径,被视为原因之一。

01 三次被否决的“兵变”

蒸馏(Distillation)即利用其他大模型的输出数据训练自身模型,是行业公认的快速追赶“捷径”。公开报道显示,字节内部至少发生过三次关于是否采用蒸馏路线的激烈争论。

第一次冲突发生在 2025 年 1 月。DeepSeek-R1 问世后,其推理风格席卷全球,Seed 内部有研究员提议跟进蒸馏,但被张一鸣拒绝。他强调,Seed 需要像人类一样“学习如何思考”,而非模仿他人的“碎碎念”。

第二次冲突源于英伟达 Blackwell 芯片部署带来的算力差距。面对对手拿到最新入场券而字节只能靠 H20 支撑的局面,蒸馏呼声再起。张一鸣再次否决,转而选择增资 2000 亿,在乌兰察布和怀来扩建智算中心。

第三次压力来自 Kimi K3 跻身全球顶尖榜单。每次国内新模型发布都是一次压力测试,内部焦虑达到顶点。但在张一鸣看来,榜单是虚的,商业主权才是实的。

据悉,内部对开源模型的蒸馏禁令早已通过 API 检测等技术手段硬性执行,早在 2023 年 4 月便明令禁止将 GPT 生成数据混入训练集。有国内大厂高管评价:“阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。”

蒸馏虽能像“背老师答案”般让模型分数在几周内突飞猛进,但随着赛道进入深水区,争议爆发。2026 年以来,Anthropic 连续指责多家中国大模型存在蒸馏行为。然而讽刺的是,Anthropic 自身也被曝存在类似行为。

张一鸣坚持“不抄捷径”的背后,是更深层的技术判断:在数据见顶、算力受限、全球模型竞争白热化的阶段,靠蒸馏永远只能追随,甚至会在下一轮智能跃迁中彻底掉队。

02 四个工程“死理”:为何字节不做“蒸馏派”

从技术演进逻辑看,字节 Seed 坚持从头训练是一套环环相扣的战略选择。虽然痛苦,但这被认为是突破天花板的唯一解。

▎拒绝合成数据的“近亲繁殖”陷阱

蒸馏的本质是用别人模型的输出作为“标准答案”,这隐藏着不可逆的致命缺陷:模型坍缩。2024 年《Nature》封面研究证实,若模型反复用 AI 生成数据训练,原始数据分布中的尾部信息会逐渐消失,导致能力退化。

这如同“近亲繁殖”,基因多样性快速流失,隐性缺陷终将爆发。ICLR 2025 的 Meta 研究进一步指出,即便掺入千分之一的合成数据,也足以触发坍缩,且模型参数越大,效应越明显。

真实世界的知识分布不均,常见的“头部”信息只占一部分,而罕见的边缘场景、反常识提问及小众专业知识藏在“长尾”中,决定了模型处理未知问题的上限。AI 生成的“标准答案”天生会抹平这些长尾,导致模型世界观狭隘。

字节最大的底气在于数据。抖音、头条及 TikTok 构成的全球最庞大原生人类内容池,提供了 PB 级的真实视频、文本及交互数据。只有清洗这些原生真实数据,才能完整保留现实世界的分布,包括那些鲜活、不可预测的长尾信息。Scaling Law 的本质是用更多高质量真实数据推高智能天花板,而非在已有边界内做平滑。

▎拿回词表里的技术主权

词表是模型的“眼睛”,决定了语言切分的颗粒度。使用别人的词表,意味着接受了对方的语言偏好。例如 Llama 的词表针对英语优化,处理中文成语或网络热梗时效率低下且语义割裂。

在多模态领域,这一影响更为致命。字节 Seed 系列的核心战场是原生多模态,如 Seedance 2.0 实现的音画同步视频生成。这要求模型在底层实现文本、视频帧、音频信号的原子级映射。

若蒸馏他人模型,便继承了别人的编码地基,无法改变底层的 Token 空间和语义框架。不蒸馏,意味着字节可以从零定义规则,自主决定视频帧 Token 化粒度、音频编码方式及多模态联合注意力机制。对于志在视频生成与多模态交互的字节而言,地基的自主权远比短期榜单排名重要。

▎硬件限制下的“重工业”内功

蒸馏是轻量级的“微创新”,见效快成本低;而从头训练 200B 以上参数的 MoE 大模型,则是真正的 AI“重工业”,比拼的是整套工程体系的硬实力。

超大规模预训练中,MTBF(平均无故障时间)是关键指标。数万张 GPU 并行计算数月,任何硬件故障都可能导致前功尽弃。集群规模越大,故障概率越高,必须具备毫秒级故障检测、断点续训及容错恢复机制。

受限于美国芯片出口管制,字节无法采购最新的 Blackwell 芯片,只能使用性能受限的 H20。这种先天劣势倒逼字节将基础设施能力推向极限:布局多地智算中心,搭建数万卡规模的分布式算力网络。2026 年,字节 AI 基础设施资本开支上调至超 2000 亿元,净利润同比下滑,正是源于此集中投入。

张一鸣将一半精力倾注于 Seed 团队,押注的是一整套能稳定支撑超大规模训练的全栈工程体系。这套能稳稳撑起“万亿参数从零训练”的基建能力,才是字节真正的技术护城河。

▎奖励模型的“灵魂归属”:学答案,永远学不会思维

蒸馏学的是“答案”,从头训练学的才是“思维”。用别人模型的输出训练,继承的是对方的输出分布、语气套路乃至价值观偏好。模型知道说什么,却不知为何这么说。

更关键的是,模型的“灵魂”会打上别人的烙印。后续再做 RLHF(人类反馈强化学习),也只是在别人的地基上装修,难以根本改变行为模式。

字节需要完全对齐自身业务逻辑的奖励模型。抖音的完播率、电商的转化率、短视频的节奏感,这些独特的商业逻辑必须深度植入 Reward Model。只有从头训练,实现从预训练到 RLHF 全链路自主,字节才能让模型真正对齐自己的商业逻辑,这不仅关乎效果,更关乎可控性。

03 字节的底牌:10 万亿参数大模型

拒绝捷径后,字节的追赶路径逐渐清晰。据《金融时报》报道,字节正在讨论训练一个参数规模达 10 万亿的大模型,显著超过阿里 Qwen 3.8-Max 和月之暗面 K3,是目前国内已知规模最大的模型计划。该项目由 Seed Foundation 负责人项亮主导,仍处于早期探索阶段。

这是一个非常“字节”的选择:与其在同尺寸参数上内卷,不如直接将规模拉大到同行的数倍,用一次量级跃迁争取领先。在数据质量与训练效率达标的前提下,Scaling Law 依然可靠。当主流玩家还在 2-3 万亿参数区间竞争时,字节直接冲击 10 万亿,本质是用规模换时间,跳过中间步骤,直接触摸下一个梯队门槛。

但这同样是一场豪赌。参数规模翻倍,训练难度呈指数级上升。2000 亿资本开支、利润下滑、创始人精力倾斜,所有筹码都压在了这条“更慢更难”的路上。

这条路的价值不止于技术本身。在知识产权争议频发、数据安全纳入国家安全范畴的背景下,全链路自研的模型没有合规包袱,无论是全球化布局还是长期竞争,都站在更安全的位置。

未来 3 年,大模型技术范式窗口期急剧收窄。蒸馏的诱惑在于确定性,但代价是失去定义终点的资格。张一鸣明确期望 Seed 模型能力跻身世界第一梯队。掌握技术主权,真正参与定义智能上限的机会,正是这条难走之路的回报。

参考链接:https://www.theinformation.com/articles/bytedances-founder-rules-distillation-ai-models?rc=gznj9j

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读207.9k
粉丝0
内容8.9k