项目地址
https://github.com/JustVugg/colibri
类别
C
项目标题
把超大稀疏模型放进普通电脑运行
项目描述
这是一个用纯 C 编写的本地大模型推理引擎,把显存、内存和硬盘统一作为模型权重的分层存储。它按需读取混合专家模型中的活跃专家,让内存装不下完整权重的电脑也能运行 GLM、Kimi、DeepSeek 等超大模型,并提供聊天、OpenAI 兼容接口和网页监控面板。
亮点
- 推理时只调入当前 token 需要的专家权重,有限内存影响速度,但不会为了省内存静默改变路由或权重精度。
- 引擎核心使用 C 实现,不依赖 BLAS;CPU、CUDA、Metal、Vulkan 和 NVMe 可按机器条件组合。
- 同一套
coli chat、coli serve、coli web 入口可运行多个 MoE 模型家族,启动器会根据模型配置选择对应引擎。
- 网页面板可查看首 token 延迟、生成速度、显存/内存/硬盘分层,以及专家路由热度;仓库还公开了基准测试方法和不同硬件的测量记录。
- 提供 Linux、macOS 和 Windows 的预编译包;也可从源码构建,并用
doctor、plan、tune 检查模型文件和硬件配置。
示例代码
git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh
COLI_MODEL=/path/to/model ./coli chat
截图或演示视频
网页仪表盘展示实时生成指标、硬件信息和权重所在的存储层级:

Brain 页面用颜色和亮度呈现专家所在层级与路由热度:

Atlas 页面以三维视图展示按路由亲和度整理的专家分布:

项目地址
https://github.com/JustVugg/colibri
类别
C
项目标题
把超大稀疏模型放进普通电脑运行
项目描述
这是一个用纯 C 编写的本地大模型推理引擎,把显存、内存和硬盘统一作为模型权重的分层存储。它按需读取混合专家模型中的活跃专家,让内存装不下完整权重的电脑也能运行 GLM、Kimi、DeepSeek 等超大模型,并提供聊天、OpenAI 兼容接口和网页监控面板。
亮点
coli chat、coli serve、coli web入口可运行多个 MoE 模型家族,启动器会根据模型配置选择对应引擎。doctor、plan、tune检查模型文件和硬件配置。示例代码
截图或演示视频
网页仪表盘展示实时生成指标、硬件信息和权重所在的存储层级:
Brain 页面用颜色和亮度呈现专家所在层级与路由热度:
Atlas 页面以三维视图展示按路由亲和度整理的专家分布: