一个月前,贾扬清离开英伟达的消息引发业界广泛关注。当时外界普遍推测,这位在阿里云、LeptonAI 及英伟达 DGX Cloud 深耕多年的技术领袖,大概率会回归 GPU 云赛道。毕竟,他在算力调度、多云部署及 GPU 利用率等 Infra 领域拥有深厚积累。
如今,答案正式揭晓。贾扬清联合 Junjie Bai、Xiang L.、Casber Wang 等开源领域资深专家,共同创立新公司Intent Lab(意图实验室)。此次创业,他并未延续 GPU 云平台或传统 AI Infra 路线,而是直指一个更核心的命题:当模型编码能力日益精进,AI 距离真正自主开发生产级软件,究竟还差哪一步?
伴随官宣,Intent Lab 展示了首批核心成果:
- 推理引擎优化:基于 GLM-5.2,在两台 Grace Blackwell 节点上将输出速度从 102 tokens/s 提升至 647 tokens/s,性能提升 6.3 倍;
- 数据库引擎构建:从模糊需求出发,自动生成并通过 600 万条 SQLite 兼容性测试;
- 分布式文件系统:构建带形式化验证的 AgentFS,成功识别并修复了普通 Coding Agent 生成代码中的数据损坏 Bug。
从推理引擎到数据库,再到文件系统,这些看似独立的底层工具,实则共同彰显了背后同一套系统 Fleet 的核心能力。
贾扬清将 Fleet 定义为"全球首个将意图转化为生产级软件的自主团队"。其核心理念在于:用户无需下达具体的“写代码”指令,只需提出高层目标,Fleet 即可由一组智能体自主完成理解、设计、编码、验证及后续演进的全流程。这标志着贾扬清的再创业超越了个人职业变动范畴,折射出 AI Infra 领域的深刻变革。
AI Infra 的底层命题重构
回顾过去十年,贾扬清作为 Caffe、ONNX、PyTorch 1.0 的核心贡献者,奠定了上一代 AI 框架的基础;随后在阿里和英伟达主导大规模基础设施建设;创立 LeptonAI 则致力于降低开发者使用 GPU 和部署模型的门槛。而 Intent Lab 的愿景,则是让 AI 直接构建具备交付能力的基础软件。
这一转变背后,是AI Infra 价值的重估。2023 年,降低 GPU 集群管理门槛曾是价值数亿美元的命题,但随着 Cursor、Claude Code、Codex 等Agentic Coding 工具的崛起,软件开发的底层逻辑已被重塑。开发者可通过自然语言描述需求,由 AI Agent 自动生成、调试并部署完整的基础设施代码。
这意味着,传统 AI Infra 试图通过产品化封装的复杂性,正被 Agentic Coding 以代码生成的方式直接绕过。仅停留在“让工程更省事”工具层的平台,正面临被开源组件与 Agent 组合替代的系统性挑战。这也解释了为何部分项目未能达到预期效果。
因此,AI Infra 创业的核心拷问已变为:你解决的是表层的复杂性,还是底层的稀缺性?贾扬清的答案清晰明确:不做包装复杂性的中间件,而是打造那个“能产出一千个系统的系统”。
从 AI 写代码到造工程团队
Intent Lab 的核心产品 Fleet,并非更快的代码补全工具或 IDE 插件,而是一套面向生产系统的自主智能体团队。
当前大多数 Coding Agent 仅解决“代码生成”问题,如编写函数、修复 Bug 或实现小功能。然而,真实的软件工程远不止于此,它涵盖需求理解、目标拆分、架构设计、接口定义、性能权衡、编码测试、评审验证及上线运维的全生命周期。
Fleet 的目标是将整条链路交给 AI,从粗糙的人类意图出发,端到端完成设计、实现和验证,并在生产环境中持续进化。它旨在复刻一支靠谱工程团队的完整协作流程,而非单纯自动化某个动作。
这也是 Intent Lab 首批展示推理引擎、数据库和文件系统的原因。这些并非“能跑就行”的应用层软件,而是对性能、可靠性、兼容性和正确性要求极高的系统软件。
以 GLM-5.2 推理引擎为例,Fleet 接收的高层意图是:改造 TensorRT-LLM,使其在 Grace Blackwell 节点上运行更快,并自行识别优化空间、实施优化及验证结果。这是在英伟达高度优化的体系上进行的硬核系统优化,而非低水平的代码生成。
Fleet 最终交付了四类优化:
- 内核层优化:通过 Kernel Fusion 及直接生成 PTX/SASS,绕过普通编译器路径,实现细粒度指令级控制;
- 运行时优化:利用 H2D Batching 大幅减少 CPU 到 GPU 的元数据拷贝,降低调度开销;
- 通信优化:将 Residual Add 和 RMSNorm 融入融合后的 All-Reduce,减少 Kernel Launch 和内存往返;
- 投机解码优化:配合更优的 Drafter,实现多 Token 并行提出与批量验证,显著提升吞吐。
最终,GLM-5.2 输出速度提升 6.3 倍。更关键的是 Fleet 的工作方式:它像系统工程团队一样,进行瓶颈分析、方案提出、实施验证,失败回退,成功后寻找下一瓶颈,形成了自动化的系统工程循环(Looping)。
为何选择数据库与文件系统?
若推理引擎展示了性能优化能力,那么数据库和文件系统则验证了复杂系统的正确性。
在数据库案例中,Fleet 从一句话需求生成数据库引擎,并通过了 600 万条 SQLite 兼容性测试。数据库不仅需执行 SQL,还需处理查询语义、存储结构、事务行为及边界条件。许多 Bug 仅在复杂语句、异常输入或并发状态下暴露。Fleet 的成功证明其能将自身置于严格测试体系中,不断修正直至满足生产级要求。
第三个案例是专为 AI Agent 设计的分布式文件系统AgentFS。针对 Agent 在云端高频启动沙箱、扫描目录及读写大量小文件的特性,传统方案如 Amazon EFS、S3FS 难以胜任。AgentFS 在目录创建、文件读写等基础操作上,相比 EFS 提升数十倍至数百倍,部分指标超 600 倍;Git 仓库操作速度也提升 2.5 至 14 倍。
更为关键的是,Fleet 不仅生成代码,还验证其可靠性。通过对核心协议进行约 190 万个状态的形式化验证,结合 300 个集成测试、故障注入和模糊测试,Fleet 成功发现并修复了一个由 Coding Agent 导致的分布式文件数据损坏 Bug。这表明 Fleet 能围绕真实负载重新设计系统,并同时将性能与正确性做到可验证。
这正是当下Agentic Coding 的分水岭。虽然 AI 写代码能力进步迅速,但在面对复杂系统、长依赖链及高错误代价场景时,许多 Agent 仍易从“效率工具”沦为“风险来源”。Intent Lab 旨在填补这一空白,推动基础设施的主体从人转变为 Agent。
AI Infra 的新分水岭
纵观贾扬清的技术路径,主线始终是降低算力和系统的使用门槛:Caffe 推动深度学习普及,PyTorch 确立生产基础设施地位,Lepton AI 优化 GPU 集群体验。而在 Intent Lab,他试图将“构建生产级系统”从手艺活转化为自动化流程。
这标志着 AI Infra 价值的根本性转移。过去,Infra 的核心价值在于“资源与封装”;随着 Agentic Coding 的崛起,封装复杂性的价值正被 AI 消解。真正的稀缺性转向让 AI 理解模糊意图、拆解架构设计、持续验证并发现隐藏 Bug 的深层系统能力。
简言之,AI Infra 的竞争正从“帮人管理基础设施”转向"让 AI 成为基础设施的建造者"。若此方向跑通,未来软件形态将更加碎片化与专用化。因为软件的本质是将意图转化为机器规则,而新的 Infra 层正致力于解构这一翻译过程。
声明:本文为 InfoQ 原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

