Skip to content

[开源推荐] 把超大稀疏模型放进普通电脑运行 #3555

Description

@enwaiax

项目地址

https://github.com/JustVugg/colibri

类别

C

项目标题

把超大稀疏模型放进普通电脑运行

项目描述

这是一个用纯 C 编写的本地大模型推理引擎,把显存、内存和硬盘统一作为模型权重的分层存储。它按需读取混合专家模型中的活跃专家,让内存装不下完整权重的电脑也能运行 GLM、Kimi、DeepSeek 等超大模型,并提供聊天、OpenAI 兼容接口和网页监控面板。

亮点

  • 推理时只调入当前 token 需要的专家权重,有限内存影响速度,但不会为了省内存静默改变路由或权重精度。
  • 引擎核心使用 C 实现,不依赖 BLAS;CPU、CUDA、Metal、Vulkan 和 NVMe 可按机器条件组合。
  • 同一套 coli chatcoli servecoli web 入口可运行多个 MoE 模型家族,启动器会根据模型配置选择对应引擎。
  • 网页面板可查看首 token 延迟、生成速度、显存/内存/硬盘分层,以及专家路由热度;仓库还公开了基准测试方法和不同硬件的测量记录。
  • 提供 Linux、macOS 和 Windows 的预编译包;也可从源码构建,并用 doctorplantune 检查模型文件和硬件配置。

示例代码

git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh
COLI_MODEL=/path/to/model ./coli chat

截图或演示视频

网页仪表盘展示实时生成指标、硬件信息和权重所在的存储层级:

Colibri 网页仪表盘

Brain 页面用颜色和亮度呈现专家所在层级与路由热度:

Colibri Brain 专家视图

Atlas 页面以三维视图展示按路由亲和度整理的专家分布:

Colibri Atlas 专家分布

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions