贾扬清离开英伟达再创业
加入英伟达一年后,前阿里副总裁、Lepton AI 创始人贾扬清再度开启创业征程。其新公司 Intent Lab 首批公开成果包括:目前已知最快的 GLM-5.2 推理引擎、一句话生成的数据库引擎,以及一套带形式化验证的文件系统。
这三项看似独立的技术成果,实则均源自同一套名为"Fleet"的智能体系统。该系统定位为“首个将意图转换为生产级软件的自主团队”,旨在实现从模糊需求到生产级代码的全流程自动化。
回顾贾扬清的创业轨迹,2023 年 3 月他从阿里巴巴离职创立 Lepton AI,专注于 AI Infra 领域,通过云原生架构调度全球 GPU 资源。2025 年春,英伟达以约 7 亿美元收购 Lepton AI,将其整合进 DGX Cloud 体系,意在构建超越 AWS 和 Google 的软件平台。
然而,融合过程并不顺利。Lepton AI 原本“轻量级、Python 原生”的开发者友好理念,与英伟达面向大企业客户的封闭管理体系存在冲突。据报道,DGX Lepton 在收购后数月内便停止对外运营,核心多租户技术难题未解,团队精力被消耗于 UI 调整等表层工作。此外,英伟达曾承诺的开源计划也被搁置,仅开放了客户端 SDK,后端核心引擎依然封闭。这主要源于核心调度器若开源,将助力竞争对手高效管理非英伟达 GPU,与其硬件销售商业模式相悖。
尽管职业生涯深耕于 Caffe、PyTorch 等开源项目,贾扬清最终选择好聚好散。短暂担任 Hyperbolic Labs 顾问后,他确立了新的方向:不再是一次构建一个系统,而是打造能一次性产出成千上万个系统的生成引擎。
首批交出三份作业
Intent Lab 的核心产品 Fleet 展示了端到端自主完成复杂工程任务的能力。在首批公开的三个案例中,Fleet 全程无人工介入,独立完成了架构设计、编码、测试及优化。
GLM-5.2 推理引擎优化
针对英伟达已高度优化的 TensorRT-LLM 项目,Fleet 接收到的指令仅为“改造代码以适配 Grace Blackwell 节点并自我优化”。系统自主识别瓶颈并实施四类优化,使输出速度从 102 tokens/s 提升至 647 tokens/s,性能提升达 6.3 倍。
具体优化细节包括:
- 内核层面(+24%):通过 Kernel Fusion 及 Agent 直接生成 PTX 和 SASS 指令,绕过编译器实现指令级控制。
- 运行时(+16%):利用 H2D Batching 技术,将稳态 Decode 步骤中的 Host-to-Device 元数据拷贝次数降至零。
- 通信层面(+18%):采用融合的 MNNVL All-Reduce 策略,将残差加法和 RMSNorm 融入集合通信,减少 Kernel 启动及内存往返。
- 投机解码(+400%):配合优化的 DSpark Drafter,实现多 Token 并行提出与验证。
Fleet 在此过程中模拟了完整开发团队的工作流:进行 Roofline 分析、识别瓶颈、提出方案、验证效果,若验证失败则自动回滚重试,直至找到最优解。
零文档数据库引擎
在数据库项目中,Fleet 仅凭一行 Prompt 启动,在无文档、无初始代码的情况下,自主扮演架构师、开发者、测试员及 QA 等角色,最终通过了 600 万条 SQLite 兼容性测试。
带形式化验证的文件系统
面对高复杂度的文件系统开发,Fleet 引入了形式化验证机制。系统成功捕捉并修复了一个由 Coding Agent 引发的瞬态损坏 Bug,体现了基础设施构建主体从“人”向"Agent"的转变。
模型能力不是限制,是中间缺一层
贾扬清指出,当前大模型虽已具备快速生成代码的能力,但从“可运行代码”到“可长期维护的生产级软件”之间仍存在显著差距。这一差距并非模型能力不足,而是缺乏一个能将模糊意图转化为严谨设计、自动验证结果并确保系统持续演进的中间层。
Intent Lab 将这一中间层细化为六个自主环节:
- Understand(理解):将模糊意图收敛为明确的产出物与验收标准。
- Design(设计):权衡取舍,确定接口规范与系统结构。
- Coordinate(协调):拆解任务并管理依赖关系。
- Build(构建):同步推进代码编写与架构演进。
- Verify(验证):贯穿全程,涵盖形式化证明至运行时故障注入。
- Evolve(演进):在生产环境中观察表现,依据成本与使用情况反哺设计优化。
这六个环节复刻了成熟工程团队的日常作业流程,但执行主体已完全替换为智能体系统。
贾扬清认为,过去五十年“造一个软件卖给所有人”的模式正在终结。未来,软件数量将爆发式增长,且定制化程度极高。Intent Lab 计划重点攻克那些因工程量过大而长期被搁置的系统项目,让算力获取与应用变得更加普惠。

