2026 年 3 月 16 日,英伟达 GTC 大会开幕,创始人兼 CEO 黄仁勋发表主题演讲。他宣告英伟达已从“芯片公司”蜕变为"AI 基础设施与工厂公司”,并详细阐述了驱动未来增长的底层逻辑——"Token 工厂经济学”。
面对市场对业绩持续性的关注,黄仁勋给出了极度乐观的预期:到 2027 年,全球 AI 计算需求至少将达到 1 万亿美元。他指出,未来的数据中心将演变为生产 Token 的“工厂”,而每瓦性能将成为决定商业竞争力的核心命脉。
业绩指引:2027 年万亿需求可期
随着大模型从“感知生成”进化至“推理行动”,算力消耗呈指数级增长。黄仁勋在演讲中直言:
去年此时,我们看到了覆盖 Blackwell 和 Rubin 直到 2026 年的 5000 亿美元高确信度需求。而现在,我看到到 2027 年至少有 1 万亿美元的需求。甚至可能供不应求,实际计算需求将远超此数。
这一万亿预期直接推动英伟达股价上涨超 4.3%。黄仁勋强调,英伟达系统凭借通用性,能运行几乎所有领域的 AI 模型,是客户投入资金保持长久生命周期的最佳选择。目前,英伟达 60% 业务来自五大超大型云服务商,其余 40% 广泛分布于主权云、企业、工业及边缘计算领域。
Token 工厂经济学:每瓦性能定生死
黄仁勋提出全新的商业思维:未来的数据中心不再是存储仓库,而是生产 Token 的工厂。由于电力物理限制(如 1GW 工厂无法变为 2GW),在固定功率下,每瓦 Token 吞吐量越高,生产成本越低。
基于此,AI 服务将分层定价,Token 生成速率直接转化为收入:
- 免费层:高吞吐、低速度
- 中级层:约每百万 Token 3 美元
- 高级层:约每百万 Token 6 美元
- 高速层:约每百万 Token 45 美元
- 超高速层:约每百万 Token 150 美元
英伟达架构不仅能在免费层实现极高吞吐量,更能在最高价值的推理层级将性能提升 35 倍。
Vera Rubin 与 Groq:两年实现 350 倍加速
为突破物理极限,英伟达发布了史上最复杂的 AI 计算系统 Vera Rubin。该系统采用 100% 液冷设计,彻底消除传统线缆,机架安装时间从两天缩短至两小时。
通过端到端软硬协同,Vera Rubin 在两年内将 Token 生成速率从 2200 万提升至 7 亿,实现 350 倍增长,远超摩尔定律的 1.5 倍提升。
针对极速推理场景,英伟达整合了收购的 Groq 技术,提出“非对称式分离推理”方案:
- Vera Rubin:负责需海量算力和显存的“预填充(Pre-fill)”阶段。
- Groq:负责对延迟极度敏感的“解码”阶段,拥有 500MB SRAM,专为低延迟优化。
黄仁勋建议:若以高吞吐为主,100% 使用 Vera Rubin;若有大量高价值代码生成需求,可配置 25% 的 Groq。目前,三星代工的 Groq LP30 芯片已量产,首台 Vera Rubin 机架已在微软 Azure 运行。
此外,英伟达展示了全球首款量产的共封装光学(CPO)交换机 Spectrum X,明确铜缆与光互联将并行发展,共同满足产能需求。
Agent 革命:SaaS 转向 AaaS
软件生态方面,黄仁勋将开源项目 OpenClaw 誉为“智能体时代的操作系统”,称其数周内成就超越了 Linux 三十年的发展。他断言,所有 SaaS 公司将转型为 AaaS(智能体即服务)公司。
为确保企业级应用安全,英伟达推出了 NeMo Claw 参考设计及包含策略引擎、隐私路由器的安全层 Open Shield。
职场形态也将随之改变。黄仁勋描绘道:“未来工程师的薪酬将由‘年薪 +Token 预算’构成。Token 额度将成为硅谷招聘的新筹码,旨在让员工效率提升 10 倍。”
演讲最后,黄仁勋剧透了下一代架构 Feynman 及部署在太空的数据中心计算机"Vera Rubin Space-1",展现了 AI 算力向地球外延伸的宏伟愿景。
CUDA:二十年的技术飞轮
今年是 CUDA 诞生二十周年。作为英伟达战略的核心,CUDA 通过 SIMT 技术大幅降低了并行编程难度。经过二十年积累,全球已部署数亿块运行 CUDA 的 GPU,形成了强大的生态飞轮:庞大的装机量吸引开发者,开发者创造新算法催生新市场,进而进一步扩大装机量。
这种生态优势赋予了基础设施极长的使用寿命。即便六年前的 Ampere 架构,因软件持续优化和兼容性,其云端价值反而上升。
从 GeForce 到神经渲染
从二十五年前推出可编程着色器奠定 GeForce 基业,到如今 RTX 引入光线追踪,英伟达始终引领图形技术变革。本次大会展示了 DLSS 5 与神经渲染(Neural Rendering)技术,将结构化 3D 数据与生成式 AI 深度融合,实现了既美观又完全可控的实时内容生成。
数据结构化与非结构化的全面加速
针对企业核心的结构化数据(SQL、Data Frame)和非结构化数据(向量、视频、文本),英伟达推出了 cuDF 和 cuVS 基础库。通过与 IBM、Dell、Google Cloud 等合作伙伴的深度集成,加速计算在速度、规模和成本上带来了三位一体的提升。
云服务商的深度协同
英伟达与全球主要云厂商建立了互利共赢的生态合作:
- Google Cloud:加速 Vertex AI 和 BigQuery,引入 CrowdStrike 等客户。
- AWS:深度集成 EMR、SageMaker,并将 OpenAI 引入 AWS 生态。
- Microsoft Azure:共建超级计算机,支持保密计算,确保模型数据安全。
- Oracle 与 CoreWeave:分别作为首个 AI 云客户和首家 AI 原生云,共同推动算力普及。
垂直整合与横向开放战略
英伟达坚持“垂直整合、横向开放”的战略。通过深入理解各垂直行业算法,提供专用加速库(CUDA-X),同时保持平台开放性,将技术整合进任何合作伙伴的系统中。目前,金融服务、医疗健康、自动驾驶、机器人及电信等行业均已深度受益。
AI 原生企业与三大历史突破
过去两年,风险投资向 AI 初创企业注入了创纪录的 1500 亿美元。这一繁荣源于三大技术突破:
- ChatGPT:开启生成式 AI 时代,计算模式从检索转向生成。
- 推理 AI(如 o1):赋予 AI 自我反思与规划能力,大幅增加计算需求。
- Claude Code:首个智能体模型,能自主编写、测试并迭代代码,标志着 AI 从“感知”走向“行动”。
Grace Blackwell 与 NVLink 72
为应对推理需求的爆发,英伟达重构系统架构,推出 NVLink 72 和 Grace Blackwell 平台。结合 NVFP4 新计算类型及 Dynamo 等新算法,其在每瓦 Token 数和每 Token 成本上遥遥领先,推理性能较前代提升高达 35 至 50 倍。
NVIDIA DSX:AI 工厂的数字孪生
为解决吉瓦级 AI 工厂的设计与运营难题,英伟达推出基于 Omniverse 的 DSX 平台。该平台提供机架级的机械、热学及网络仿真,可将能源利用效率提升约 2 倍。同时,英伟达正与合作伙伴开发太空数据中心 Vera Rubin Space-1,拓展算力边界。
物理 AI 与机器人规模化落地
具身智能(物理 AI)迎来爆发。本次 GTC 展出 110 款机器人,涵盖人形、工业及自动驾驶领域。英伟达宣布比亚迪、现代、日产、吉利加入 RoboTaxi Ready 平台,并与 Uber 达成重大合作。此外,Disney 的 Olaf 机器人现场演示了基于 Newton 求解器的物理仿真行走能力,展示了数字孪生技术在现实世界的完美映射。
总结:迈向智能体新时代
黄仁勋总结道,推理拐点已至,Token 成为新的大宗商品。数据中心正演变为高效的 Token 工厂,而 OpenClaw 将引领企业 IT 从工具时代迈向智能体时代。随着物理 AI 的规模化落地,人类正站在一个全新计算平台变革的起点。


