HAMi 的走红,被形容为开源世界的“烟火”——绚烂却难以为继。两年前,在 KubeCon 大会上,李孟轩目睹成熟项目的盛况,而彼时的 HAMi 仅是个名字,社区寥寥,未入 CNCF,被他自嘲为“小卡拉米”。与此同时,张潇在企业交付一线深受 GPU 资源管理之困:整卡分配导致浪费、多租户隔离难、故障定位复杂。
两人视角互补:一个看见开源潜力,一个洞察生产痛点。2026 年 7 月 2 日,HAMi 正式通过 CNCF 技术监督委员会评审进入孵化阶段,被数百家企业采用,汇聚了厂商与开发者。然而,进入孵化只是起点。当代码与治理移交基金会,围绕项目成立的密瓜智能如何生存?李孟轩给出克制判断:"HAMi 成功是密瓜成功的必要条件,但非充分条件。”
被整卡分配困住的 GPU
HAMi(Heterogeneous AI Computing Virtualization Middleware)旨在解决企业 GPU 资源闲置与分配僵化的问题。传统模式下,任务往往独占整张显卡,即便仅使用部分显存,剩余资源也无法共享,造成极大浪费。HAMi 充当“资源管理员”,将物理 GPU 切分为多个虚拟资源,实现细粒度调度与多任务隔离共享,显著提升利用率。
项目地址:https://github.com/project-hami/hami
早期 AI 负载虽模型较小,但迭代频繁。Kubernetes 已能精细调度 CPU 与内存,GPU 却长期被视为特殊设备实行“整卡分配”。2021 年前后,张潇与李孟轩基于对云原生异构算力演进的共识,推动 HAMi 诞生。李孟轩侧重底层技术虚拟化,张潇聚焦工程化落地。随着 DaoCloud、第四范式及多家芯片厂商加入,HAMi 从单一功能组件演进为具备完整工程体系的基础设施项目。
开源不仅是代码公开,更是持续运作的工程协作体系。密瓜智能团队承接了持续集成、兼容性测试、文档建设等重任,推动项目从技术雏形走向生产级基础设施。
左:密瓜智能联合创始人& CTO 李孟轩;右:密瓜智能创始人& CEO 张潇
缺的不是又一个调度器,而是跨厂商生态
市场上不乏 GPU 虚拟化方案,但多受限于特定硬件或云平台边界。英伟达方案绑定自家 GPU,云厂商能力深度耦合自有设施,独立软件商难以跟上全厂商迭代速度。面对企业中多代际、多品牌(如昇腾、AMD 及国产芯片)共存的复杂现状,单点适配如同推石上山。
HAMi 试图完成“依赖反转”:不再由项目团队被动适配,而是吸引芯片厂商主动扎根社区,在新品发布时同步提交代码,实现 Day 0 支持。目前,已有众多厂商投入研发资源,主动贡献设备能力。HAMi 定位为 Kubernetes 与异构设备间的中间层,将不同硬件抽象为统一资源,赋予企业选择权,避免被单一厂商锁定。
异构算力生态需要中立土壤。HAMi 进入 CNCF 并非仅为背书,更是为了证明其中立性。交由基金会治理意味着代码、商标及所有权遵循开放规则,降低了企业用户面临的项目停更、闭源或许可变更风险。对李孟轩而言,这标志着 HAMi 真正“跨过鸿沟”,从概念走向生产基础设施。
生产级系统开始为开源项目投票
开源项目的价值最终由生产系统验证。HAMi 早期用户包括某上市互联网金融公司,部署后 GPU 利用效率提升超一倍。随后,顺丰科技等企业合作发表行业白皮书。真正让团队看到商业闭环的,是一家大型股份制银行。该银行面临多厂商 GPU 共存、私有环境高稳定性要求等挑战,急需统一管理异构算力。
在此项目中,银行、国产 GPU 厂商、HAMi 社区与密瓜智能形成闭环:厂商借 HAMi 进入客户环境,银行降低管理复杂度,生产需求反哺社区迭代,密瓜智能提供交付保障并获取收入。这一案例证明,大型企业愿为跨厂商适配与生产保障付费。
生产用户的需求也重塑了 HAMi 的技术路线:从专注英伟达虚拟化扩展至全异构算力,从设备侧切分深入至 Kubernetes 控制面调度,进而支持多集群管理、可观测性及计量计费。张潇表示,这是一个个具体生产需求将项目推向完整基础设施的过程。
HAMi 之外,为什么还需要密瓜智能
随着应用场景深入,仅靠社区难以承担生产系统的全部责任。社区擅长汇聚通用需求,而企业生产环境需要稳定版本、故障响应、现场支持及明确责任主体。密瓜智能的成立,正是为了补上这一缺口。
李孟轩关注技术架构与社区边界,确保项目通用性;张潇则聚焦商业逻辑,回答为何客户愿意付费。密瓜智能确立基本边界:跨厂商兼容等通用能力进入开源主干,面向具体场景的生产保障、系统集成则由企业产品承接。
密瓜智能并非将 HAMi 闭源,而是建立责任主体。通过将项目交给 CNCF 保证中立性,同时成立公司集中资源确保持续维护,解决了开源项目的持续性与信任问题。
把 GPU 利用率变成一笔能算清楚的账
在大模型时代,算力成本高昂。密瓜智能位于驱动之上,通过池化与虚拟化屏蔽硬件差异。其核心价值在于经济账:通过细粒度切分与超卖策略,将单卡资源供给多个任务。数据显示,部分场景下 GPU 综合利用率可从不足 20% 提升至 40%-50%,企业版目标更是接近 70%。
不同用户诉求各异:银行关注承载能力与国产适配,互联网关注并发与成本,云厂商关注资源售卖率。HAMi 将设备转化为可编排资源,密瓜智能则将其转化为可量化的 ROI。只有当效率提升变为可计算收益,开源使用者才可能转化为付费客户。
没有哪项技术可以永久领先
面对开源商业化壁垒问题,张潇认为技术本身易被复制,真正的护城河在于生态位置与“真机验证”。AI Infra 组件更换成本高,客户倾向选择生态广泛、持续维护的项目。HAMi 聚集了多方厂商与用户,形成生态飞轮。
更关键的是繁琐的真机验证工作。新卡上线需真实环境测试,老旧设备需兼容回归,跨厂商问题需协调修复。这些“脏活累活”构成了难以复制的上下文经验:为何如此设计、哪些参数引发故障、如何在多厂商间协调。这正是密瓜智能不可替代的价值所在。
一个必要不充分条件
展望未来,李孟轩希望 HAMi 继续向下深耕设备驱动,向上保持中间件定位,不与上层平台竞争。张潇则 envision 建立类似 Linux 内核的开放层,核心技术回馈社区。
理想需经商业检验。AI 行业日新月异,创业公司面临多重压力。回顾初心,李孟轩自评“干得不错”,张潇则认为“差强人意”。HAMi 进入 CNCF 孵化验证了问题存在与生态基础,但密瓜智能仍需完成终极考题:在技术免费的前提下,证明团队能创造不可替代的商业价值。这或许是 HAMi 跨越下一道鸿沟的关键。



