大数跨境

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声 智东西
2026-08-07
2
导读:张一鸣内部表态:反对蒸馏,不走捷径。

张一鸣内部表态:反对蒸馏,不走捷径。
作者 |  王涵
编辑 |  云鹏
智东西 8 月 7 日报道,据英国《金融时报》援引知情人士消息,字节跳动正在训练参数量高达 10 万亿的 AI 模型。此前晚点 LatePost 独家报道该数字为“超 5 万亿”。
即便按 5 万亿参数计算,该模型规模也已超越目前国内已发布的最大模型 Kimi K3,接近 Anthropic 的 Fable 5;若达 10 万亿,则将超越参数量约 8 万亿的 Mythos 5。截至发稿,字节跳动暂未对此回应。

▲英国《金融时报》报道

巨量模型训练进展与团队架构

外媒报道称,该模型目前处于早期阶段,正在进行为期 3 至 6 个月的预训练。若进展顺利,后续将进行微调并发布,最终模型尺寸将在后期确定。
据晚点 LatePost 报道,该项目由 Seed Foundation 负责人项亮主导,大语言模型预训练数据负责人沈科合作推进。
这一“巨无霸”模型爆料引发海外关注。有网友引用《蜘蛛侠》台词调侃:“能力越大,竞争越大。”若该模型能如 Kimi K3 般持续进化,将迫使行业加速追赶。另有观点认为,10 万亿参数模型尚未推出,已改写推理算力逻辑。

▲网友评论(来源:X)

▲网友评论(来源:X)

张一鸣战略定调:构筑算力优势,拒绝技术捷径

此前,字节跳动将飞书团队拆分,产品团队并入豆包,销售线划归火山引擎。张一鸣在 Seed 全员会上解释,此举旨在整合火山引擎、飞书和豆包资源,构筑算力与数据优势。

▲字节跳动创始人张一鸣(来源:36)

张一鸣认可编程(Coding)的关键地位。字节 CEO 梁汝波亦在全员会上坦承,豆包大模型在 AI Coding 方面尚不突出,并以 Anthropic 的 Claude Code 为例。但他同时提醒,编程仅是当前热点之一,需着眼更广泛领域。
尤为重要的是,张一鸣明确反对模型蒸馏。他指出,蒸馏虽能短期改善表现,但本质是复制已有能力,难以实现真正超越。即使这意味着技术上可能短暂落后于国内竞争对手,字节也坚持不走捷径。未来,字节将在 AI 方向持续加大投入。
注:模型蒸馏(Model distillation)指将大型复杂模型压缩为更小、更快模型的过程,即通过训练小型模型复制大型教师模型的知识和输出。

结语:国内大模型迎来窗口期,字节双线进攻

近期,Anthropic 的 Mythos 5 因安全顾虑被暂时禁用,Fable 5 也曾被勒令停服,OpenAI 模型亦频现安全问题。海外接连“暴雷”,为国内大模型发展撕开难得窗口期。
过去几周,月之暗面 Kimi K3 与阿里巴巴 Qwen 3.8 Max 在基准测试中表现抢眼,获国内外开发者积极反馈。业内人士透露,多家中国实验室正训练 Fable 5 规模模型,其中字节跳动押注最为激进。
不同于阿里、腾讯等同行,字节大模型多为闭源,但其 SeeDance 模型在视频生成领域已跻身全球前列。面向消费者的豆包月活达 3.24 亿,是国内最受欢迎 AI 应用。随着与飞书合并,豆包正加速向 B 端市场冲刺。
一边是产品端 B 端加速,一边是训练端激进规模与对 Coding 的强调,字节跳动正式开启“双线进攻”。
来源:英国《金融时报》、晚点 LatePost、财新

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读200.0k
粉丝0
内容11.8k