AI 大型語言模型 (LLMs)
colibri
一個無依賴的 C 引擎,從磁碟串流專家權重,可在消費級硬體上以僅 25 GB RAM 運行 744B 參數的 GLM-5.2 MoE 模型。
colibri
什麼是 colibri?
colibri 是一個輕量級、純 C 語言的推論引擎,專為 GLM-5.2 744B 參數混合專家模型設計。它從磁碟串流專家權重,運行時無需 Python、GPU 或外部依賴,可在約 25 GB RAM 的機器上本地執行。
colibri 與相似工具比較
| 計價模式 | 免費 | 免費 | 免費 | 免費, Freemium |
| 免費額度 | ||||
| 主要功能 |
|
|
|
|
| 優點 |
|
|
|
|
| 缺點 |
|
|
|
|
| 適合對象 |
|
|
|
|
如何使用 colibri?
- 1克隆倉庫:git clone https://github.com/JustVugg/colibri.git
- 2建構引擎:cd c && make
- 3將 FP8 模型轉換為 int4:./coli convert --model /path/to/model
- 4運行聊天:COLI_MODEL=/path/to/model ./coli chat
- 5(可選)使用網頁 UI 或相容 OpenAI 的伺服器以獲得圖形介面。
colibri 主要功能
- 純 C 實作,零外部依賴
- 從磁碟串流專家權重,具備 LRU 快取與可選的固定熱儲存
- 忠於 GLM-5.2 (glm_moe_dsa) 的前向傳遞,經驗證 token 完全一致
- MLA 注意力機制,壓縮 KV 快取(體積減少 57 倍)
- 原生 MTP 推測解碼,每次前向最多產生 2.8 個 token
- 整數點積核心(int8/int4)搭配 AVX2 加速
- 線上學習快取,可適應使用模式
colibri 使用情境
- 在消費級筆電或桌機上運行 744B 參數 MoE 模型
- 無需雲端依賴的離線聊天與推論
- 大型 MoE 架構的研究與實驗
- 在有限硬體上展示前沿模型能力的教育示範
colibri 價格與免費點數
colibri 目前採用 免費 模式。
colibri 優缺點
優點
- 在僅 25 GB RAM 的消費級硬體上運行 744B 參數模型
- 開源且完全透明(C 程式碼,無依賴)
- 高效的磁碟串流與快取,可長時間使用
- 活躍的社群基準測試與改進
缺點
- 冷解碼速度極慢(一般 NVMe 上約 0.05-0.1 tok/s)
- 轉換後的 int4 模型需要約 370 GB 磁碟空間
- 僅支援 GLM-5.2 模型(無法靈活切換其他模型)
- CUDA 後端仍在實驗階段且功能有限
colibri 最適合哪些用途?
- 希望在本機運行大型模型的開發者
- 在有限硬體上探索 MoE 架構的 AI 研究人員
- 無需雲端成本即可體驗前沿模型推論的愛好者