大数跨境

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人 AI前线
2026-09-03
6
导读:曾是 DeepSeek-OCR 与 DeepSeek-OCR 2 两篇论文的一作
作者 | 四月

9 月 3 日消息,据 AI 前线获悉,原 DeepSeek 核心研究员魏浩然已正式加入百度基础模型研发部(BMU),出任文心大模型多模态算法负责人。

此举是百度近期加速吸纳青年顶尖大模型人才的又一关键布局。此前在今年 7 月,出生于 1997 年、曾主导国内首个开源对话模型复旦 MOSS 研发的青年学者孙天祥,已出任百度基础模型研发部负责人,并进入百度模型委员会(BMC)与技术战略委员会(TSC)。从孙天祥统管通用基座,到魏浩然挂帅多模态算法,标志着百度模型研发中枢正加速向青年技术骨干倾斜。

多模态战绩突出

在大模型向深层通用智能演进的过程中,多模态能力被视为决定模型上限的核心支柱。魏浩然的技术标签正是多模态与端到端 OCR 的底层重构

魏浩然于今年上半年加入百度,主攻 OCR 等多模态方向。入职后,其团队在端到端文档感知领域取得重大突破,并于 2026 年 6 月开源了 Unlimited OCR 模型。该模型在权威评测基准 OmniDocBench 中斩获全球第一,刷新了端到端 OCR 性能的 SOTA 纪录,登顶 GitHub 和 Hugging Face 多个趋势榜单。

公开资料显示,魏浩然于 2023 年获中国科学院大学博士学位,长期专注于视觉语言模型(VLM)和文档智能研究。加盟 DeepSeek 前,他曾供职于阶跃星辰(StepFun)等公司,主导参与了 Vary、GOT-OCR 2.0 等多项行业代表性工作。

在 DeepSeek 期间,魏浩然是 DeepSeek-OCR 路线的核心研究者。作为第一作者,他参与了 2025 年 10 月发布的《DeepSeek-OCR: Contexts Optical Compression》及 2026 年 1 月发布的《DeepSeek-OCR 2: Visual Causal Flow》论文。该系列工作并未局限于字符识别精度的提升,而是率先提出了“利用视觉表征极限压缩长文本信息”的全新技术思路

通过自主研发的 DeepEncoder,该模型将传统方法中成千上万个文本 Token 压缩为极少量的紧凑视觉 Token。在压缩率低于 10 倍的极端条件下,模型仍保持约 97% 的 OCR 解码准确率。这一探索为解决大模型长上下文输入时的显存暴涨与计算开销过大问题,开辟了高效路径。

除 OCR 专项模型外,魏浩然也深度参与了 DeepSeek 通用基础模型研发。在 DeepSeek V3.2 作者名单中可见其名;在今年 4 月发布的 DeepSeek V4 技术报告中,他同样位列作者,但已被标注为离职成员。

青年骨干接管研发体系

魏浩然的动向发生在百度大模型组织持续变革的背景下。2025 年 11 月,百度新设基础模型研发部**(BMU)和**应用模型研发部**(AMU),将底座模型与应用模型研发拆分:BMU 专注高智能、可扩展的通用基础模型,AMU 则面向具体业务场景。

今年 5 月,百度成立模型委员会(BMC),进一步统一模型技术路线、训练策略及业务落地。

7 月 1 日,复旦 MOSS 大模型核心第一作者孙天祥正式加盟百度,执掌 BMU 并进入 BMC;7 月底百度技术战略委员会(TSC)换届,孙天祥等一线青年专家进入 TSC,标志着百度基础模型的技术决策权正式完成向新生代实战学者的交接

在此背景下,魏浩然带队加入 BMU,是孙天祥全面接手基础模型部门后,文心大模型研发阵地重新集结的关键拼图。另有内部消息称,孙天祥近期还引入了一名曾在北美顶级前沿实验室参与数代核心大模型研发的研究人员,未来将协同团队加强文心大模型预训练能力的底层建设。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8696
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读200.4k
粉丝0
内容8.7k