作者丨高允毅
编辑丨马晓宁
7 月 18 日,在 2026 年 WAIC 大会“基座大模型架构创新与生态合作论坛”召开前夕,《AI 科技评论》专访了商汤科技首席科学家林达华。
面对“大语言模型之后的决胜战场在哪”之问,林达华以办公室内的一盆绿植为例指出:人眼能瞬间感知的细节,语言往往难以穷尽。这揭示了当前大语言模型在面对真实物理世界时的隐形边界。
从高级审美设计到城市三维布局,再到自动驾驶与具身智能,凡涉及物理空间理解的场景,均离不开真正的“视觉”能力。基于语言与视觉深度融合的第一性原理,商汤将多模态确立为下一个核心战略高地。
区别于业界主流的“拼接式”路线,商汤选择了一条更具挑战的底层融合之路。今年 3 月,商汤推出原生统一多模态架构 NEO-unify;4 月发布开源模型 SenseNova U1;而在本次大会上,商汤正式推出可交付级别的旗舰模型——SenseNova U1 Pro(简称 U1 Pro)。
作为全球首个以“理解、生成、行动”原生统一为内核的多模态工具,U1 Pro 具备内生的“图文交错思维”,可直接输出原生 8K 顶级画质成片,在设计领域对标 GPT-Image-2 等全球顶尖模型。
01 为什么多模态是 Coding 之后的下一个战场
当前,AI Coding 虽是行业热点,但纯文本语言的天花板已清晰显现。林达华指出,现有代码模型生成的前端页面缺乏“苹果级”质感,高级的设计感与空间美学是纯文本逻辑的天然盲区。
随着后端逻辑能力趋同及价格战加剧,前端体验与视觉交互成为新的竞争高地。林达华强调:"CLI 是面向机器的,而视觉才是面向人类体验的。”无论是办公汇报、海报设计,还是游戏影视制作,高频大众场景的本质均离不开视觉。
打造能在物理世界中思考行动的“全能智能”,必须打破壁垒,实现视觉与语言在底层大脑的融合。然而,视觉与语言属于完全异构模态,像素无法简单对应文字词元,攻克异构模态融合一直是该领域的核心难点。
02 U1 Pro 的技术演进路径
长期以来,多模态主流技术路线采用“拼接式架构”,即外挂独立视觉编码器将图像“翻译”为文本。这种方式虽工程门槛低,但会损耗大量精细化空间和感知细节,导致融合效率低下,并非“真正看见”。
商汤团队认为,多模态的终极形态应让不同模态拥有共同的语言和表征,像人类大脑一样深度沟通。为此,商汤坚持长期主义探索:
- 2025 年中,联合南洋理工大学 S-Lab 在小规模数据上验证原生融合设想;
- 2025 年 9 月,发表论文系统阐述移除视觉编码器、建立深层融合的 NEO 架构;
- 2026 年 3 月,发布原生统一架构 NEO-unify 及相关论文,确立端到端原生统一模型设想。
在 NEO-unify 架构中,商汤彻底移除了依赖的视觉编码器和变分自编码器,采用自研的 Mixture-of-Transformers(MoT)架构,让语言和视觉信息在每一层计算中深度交融。该架构仅需 3.9 亿图像文本示例(约为业界同等性能模型的 1/10),便涌现出顶尖的视觉感知和推理能力。
基于此架构的开源模型 SenseNova U1,拥有真正的“图文交错思维链”,以 8B 体量斩获 SOTA 性能。随后,团队针对高商业价值的“信息图”赛道进行高频迭代:
- V1 版本重构底层算力,显著提升信息密度与排版质感;
- V2 版本攻克小字清晰度与排版精度难题,视觉表现比肩专业设计师;
- V3 版本引入“可编辑功能”,支持用户直接修改画面。
图注:U1 Pro 设计的关于“背包”的信息图,文字清晰准确,设计高级美观
这套技术范式在 U1 Pro 上全面爆发,标志着 AI 设计进入“交付级”时代。
03 打造专业级设计模型的核心逻辑
当前许多 AI 绘图工具在复杂排版和密集信息任务中表现不佳,原因在于“画画”靠概率,而“设计”靠精准的逻辑与控制。
林达华表示,赋予 AI 专业设计能力需用亿道“魔鬼级”题目训练。商汤构建了规模逼近数十亿级别的超大型“多模态题库”,其中单张设计图对应的文字描述往往长达上千字。训练流程分为三个阶段:
- 预训练阶段:吞吐数十亿级图文原生交错数据,夯实认知地基;
- 持续预训练阶段:利用高比例“合成数据”高强度拉升专业设计能力;
- 后训练阶段:精选千万级黄金数据精雕细琢,沉淀成品级交付质感。
支撑这一过程的是商汤内部由超级 Agent 驱动的自动化数据合成管线。林达华强调:“核心技术的突破是坚守长期主义的马拉松,能改变行业底层范式的长期价值远超一时流量热点。”
04 击穿信息图赛道,讲好商业故事
商汤将设计方向,尤其是信息图,作为多模态战略的核心落地场景。该场景在电商、广告、游戏及出海贸易等 B 端领域需求巨大。然而,AI 生图商业化长期面临图不达意、拼凑感强、无法理解设计因果及修改成本高等瓶颈。
林达华指出,商业世界的标准是“零容忍”,错一个字即为废纸。因此,他评判模型好坏的唯一标尺是“交付率”,即生成内容无需大幅修改即可直接商用。
目前,U1 Pro 的交付率稳定在 70%。在全球范围内,仅有商汤 U1 Pro 与 OpenAI 的 GPT-Image-2 超越了 60% 的商业可交付基准线。70% 交付率背后是严苛的全维度品控:文字错误率、图形元素及布局色彩细节错误均控制在千分级。
图注:U1 Pro 设计的泉州主题海报,内容丰富且设计细腻
图注:U1 Pro 设计的二十四节气海报,支持 8K 分辨率及特殊长宽比
高交付率源于商汤独创的“视觉拆解思维链”学习模式。模型在训练中会自动拆解高质量海报的视觉组件,逆向推理版式布局与色彩思路,内化设计神韵。生成时,U1 Pro 采用“多轮智能体生成闭环”:先规划方案,再生成全图,最后全局自检并反向迭代,直至符合交付标准。
此外,商汤组建了由 200 名美院学生和专业设计师构成的“人类审美团”,通过高强度的“找茬”与打分,帮助模型打磨出真正的“高级感”。
05 迈向世界模型与物理世界 AGI
采访透露,U1 Pro 已具备初步的空间推演能力。在商汤的战略版图中,世界模型与具身智能并非平行线,而是视觉与语言深度融合基座上的自然分支。
例如,生态企业大晓机器人推出的“开悟”世界模型,其底层依然是多模态底座,仅增加了具身数据的训练比例。7 月 13 日发布的 SenseNova-Vision 模型,则让视觉成为通用基础模型的原生能力,在目标检测、3D 重建等任务上超越专用模型。
展望未来,林达华透露下一代 U2 将真正走向三维,融入视频的理解与生成,实现感知、理解、生成、行动的一体化。更远处的终极形态是将模态扩展至几十种传感器信号,构建完整的世界模型。
面对物理规则复杂性带来的算力瓶颈,林达华提出解耦思路:拆分不同属性的专用子模型进行有机组合与协同推理,而非穷尽所有数据组合。
当被问及下一个技术攻关目标时,林达华毫不犹豫地回答:“物理世界的 AGI。”这或许正是智能最坚硬的部分。
图注:商汤上海办公室迎客厅书架上的碑
商汤新模型 SenseNova-U1 Pro 曝光,对标 GPT-Image-2,瞄准「设计」赛道
走访 100+ 机器人展台:拐点已至,具身智能进入千行百业|WAIC 2026
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

