AI 大语言模型 (LLM)
colibri
一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。
colibri
什么是 colibri?
colibri是一个轻量级、纯C语言实现的推理引擎,专为GLM-5.2 744B参数混合专家模型设计。它从磁盘流式传输专家权重,运行时无需Python、GPU或外部依赖,可在约25 GB RAM的机器上本地运行。
colibri 与相似工具比较
| 计价模式 | 免费 | 免费 | 免费 | 免费, Freemium |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 colibri?
- 1克隆仓库:git clone https://github.com/JustVugg/colibri.git
- 2构建引擎:cd c && make
- 3将FP8模型转换为int4:./coli convert --model /path/to/model
- 4运行聊天:COLI_MODEL=/path/to/model ./coli chat
- 5(可选)使用Web UI或兼容OpenAI的服务器获取图形界面。
colibri 主要功能
- 纯C实现,零外部依赖
- 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
- 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
- MLA注意力机制,压缩KV缓存(缩小57倍)
- 原生MTP投机解码,每次前向最多2.8个令牌
- 整数点积内核(int8/int4),支持AVX2加速
- 适应使用模式的在线学习缓存
colibri 使用场景
- 在消费级笔记本电脑或台式机上运行744B参数MoE模型
- 无需云依赖的离线聊天和推理
- 大型MoE架构的研究与实验
- 在有限硬件上进行前沿模型能力的教育演示
colibri 价格与免费额度
colibri 目前采用 免费 模式。
此工具完全免费使用
colibri 优缺点
优点
- 在仅25 GB RAM的消费级硬件上运行744B参数模型
- 开源且完全透明(C代码,无依赖)
- 带缓存的高效磁盘流式传输支持长时间使用
- 活跃的社区基准测试和改进
缺点
- 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
- 需要约370 GB磁盘空间存放转换后的int4模型
- 仅支持GLM-5.2模型(无多模型灵活性)
- CUDA后端尚在实验阶段且功能有限
colibri 最适合哪些用途?
- 希望本地运行大规模模型的开发者
- 在有限硬件上探索MoE架构的AI研究人员
- 对无需云成本进行前沿模型推理感兴趣的爱好者