大数跨境

35K+ Star! colibri:在消费级硬件上运行MoE大模型的纯C推理引擎

35K+ Star! colibri:在消费级硬件上运行MoE大模型的纯C推理引擎 AIGC创想者
2026-09-17
4
导读:colibri简介AI/MLColibri 是一个纯 C 语言编写的轻量级推理引擎,专门用于在消费级和异

colibri简介

AI/ML

Colibri 是一个纯 C 语言编写的轻量级推理引擎,专门用于在消费级和异构硬件上运行 744B 至 2.8T 参数规模的前沿混合专家(MoE)大模型。它将显存、内存和磁盘存储视为统一的推理层级,通过按需流式加载被激活的专家权重,彻底打破了超大模型对昂贵数据中心级硬件的依赖。

它解决了前沿大模型本地化部署成本极高的问题。由于 MoE 模型每次推理仅激活极少部分参数,Colibri 利用这一稀疏性,将未激活的专家权重存放在磁盘中动态调度,使得开发者仅凭普通台式机甚至笔记本电脑,就能在本地完整运行并研究千亿乃至万亿级别的开源大模型。

亮点特性

01极致轻量化架构

核心引擎仅为单个 C 语言文件,运行时零外部依赖,无需 BLAS 库、Python 环境或强制 GPU 支持

02统一多级存储调度

将 VRAM、RAM 和 NVMe 磁盘视为单一存储层级,结合 LRU 缓存与学习机制动态驻留热点专家权重,实现按需流式推理

03广泛的模型与硬件支持

单套前端命令即可运行 GLM-5.2、Kimi K3 (2.8T)、DeepSeek V4 Flash 等 8 个系列模型,并原生支持 CUDA、Metal、Vulkan 及多节点集群模式

使用场景

场景 1个人开发者或研究人员在普通工作站/游戏本上本地运行 GLM-5.2、Kimi K3 等千亿级 MoE 模型进行实验与测试

场景 2利用多台 Mac 或 PC 组建本地集群,分布式协同推理超大参数模型,摆脱云端 API 限制

场景 3作为大模型系统级优化的研究平台,验证专家路由缓存、多级存储调度、推测解码等底层推理优化假设


操作系统
Linux、macOS、Windows
编程语言
引擎为纯 C,启动器和 API 网关需要 Python 3
核心依赖
运行时无需 BLAS、Python 或 GPU;源码构建需要带 OpenMP 支持的 gcc 或 clang
存储空间
根据模型不同,需 7 GB(OLMoE)至 1.6 TB(Kimi K3)不等的磁盘空间存放权重
内存
根据模型不同,最低 8 GB(OLMoE)至 32 GB+(Kimi K3)
运行方式
下载预编译发布包直接运行,或通过源码编译

快速上手

安装步骤

方式一:下载预编译版本(推荐)
 从 GitHub Releases 页面下载对应操作系统的压缩包并解压,无需编译器:

mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibri
python3 coli info # 验证引擎就绪

方式二:源码编译
 需要安装支持 OpenMP 的 gcc 或 clang:

git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh # 自动检查环境、编译并自测

获取模型

以 GLM-5.2 int4 为例,需从 Hugging Face 下载约 372GB 的预转换权重文件(推荐使用 gs64 容器格式),放置在高速 NVMe 固态硬盘中。

核心用法示例

启动交互式命令行聊天:

COLI_MODEL=/nvme/glm52_i4 ./coli chat

启动带 Web 可视化面板的 API 服务:

./coli web --model /nvme/glm52_i4

以无头模式提供 OpenAI 兼容 API:

./coli serve --model /nvme/glm52_i4

检查当前机器的显存/内存/磁盘分配计划:

COLI_MODEL=/nvme/glm52_i4 ./coli plan

替代方案

对比 1llama.cpp

业界最流行的本地推理框架,生态极其丰富且支持海量模型格式,但 Colibri 针对 MoE 架构的磁盘流式加载和多级存储进行了更极端的专项优化,能在更低配的硬件上运行更大规模的 MoE 模型

对比 2kTransformers

同样专注于 MoE 模型的 CPU/GPU 异构推理加速,但 Colibri 采用纯 C 实现且将磁盘 I/O 深度整合进推理引擎,整体依赖更少、部署更轻量

对比 3vLLM

面向生产环境的高吞吐量推理框架,强项在于连续批处理和高并发服务,但高度依赖高端 GPU 显存,无法像 Colibri 一样在消费级硬件上通过磁盘卸载运行万亿参数模型

相关资源

项目地址github.com/JustVugg/colibri

官网justvugg.github.io/colibri

欢迎关注我,持续获取更多内容,感谢&在看~

【声明】内容源于网络
0
0
AIGC创想者
拥抱科技创新,拥抱AI,探索无限可能!
内容 846
粉丝 0
AIGC创想者 拥抱科技创新,拥抱AI,探索无限可能!
总阅读22.4k
粉丝0
内容846