AI 大型語言模型 (LLMs)

colibri

一個無依賴的 C 引擎,從磁碟串流專家權重,可在消費級硬體上以僅 25 GB RAM 運行 744B 參數的 GLM-5.2 MoE 模型。

什麼是 colibri?

colibri 是一個輕量級、純 C 語言的推論引擎,專為 GLM-5.2 744B 參數混合專家模型設計。它從磁碟串流專家權重,運行時無需 Python、GPU 或外部依賴,可在約 25 GB RAM 的機器上本地執行。

colibri 與相似工具比較

計價模式免費免費免費免費, Freemium
免費額度
主要功能
  • 純 C 實作,零外部依賴
  • 從磁碟串流專家權重,具備 LRU 快取與可選的固定熱儲存
  • 忠於 GLM-5.2 (glm_moe_dsa) 的前向傳遞,經驗證 token 完全一致
  • 原生載入 DeepSeek V4、Qwen3.6 和 GLM 5.2 模型
  • 針對記憶體受限系統的自適應 Metal 駐留與 SSD 串流
  • 具備工具呼叫與編碼代理的 HTTP 伺服器
  • 使用 Project Panama FFM API 的零分配推理
  • LLM、ASR、TTS 和多模態模型的統一運行時
  • 進程全局後端以消除 VRAM 碎片
  • 透過單一API統一存取300多種AI模型
  • 相容於OpenAI SDK的端點
  • 歐盟託管且符合GDPR的基礎設施
優點
  • 在僅 25 GB RAM 的消費級硬體上運行 744B 參數模型
  • 開源且完全透明(C 程式碼,無依賴)
  • 完全本地運行,確保資料隱私
  • 針對 Apple Silicon 最佳化,搭配 Metal 加速
  • 零分配設計,在 Java 中實現高效能
  • 跨多種模型類型(文字、視覺、音訊)的統一 API
  • 透過單一API存取300多種模型
  • 歐盟託管且符合GDPR,適合歐洲公司
缺點
  • 冷解碼速度極慢(一般 NVMe 上約 0.05-0.1 tok/s)
  • 轉換後的 int4 模型需要約 370 GB 磁碟空間
  • 主要為 Apple Silicon 設計;CUDA/ROCm 後端為次要
  • 非通用 GGUF 執行器,僅支援特定模型
  • 需要 Java 22+ 和 Project Panama(尚未在所有 JVM 中標準化)
  • 由於原生編譯,初學者的建置過程可能較複雜
  • 定價在沒有帳戶時不完全透明
  • 購買額度時3%手續費可能是隱藏成本
適合對象
  • 希望在本機運行大型模型的開發者
  • 在有限硬體上探索 MoE 架構的 AI 研究人員
  • 希望進行裝置端 LLM 推論的 Apple Silicon Mac 使用者
  • 尋求專門高效能推論引擎的開發者
  • 構建低記憶體開銷 AI 應用程式的 Java 開發人員
  • 需要本地端、高吞吐量推理的 LLM 和多模態模型專案
  • 需要多模型存取且符合歐盟合規的開發者
  • 構建AI代理和應用程式的團隊

如何使用 colibri?

  1. 1克隆倉庫:git clone https://github.com/JustVugg/colibri.git
  2. 2建構引擎:cd c && make
  3. 3將 FP8 模型轉換為 int4:./coli convert --model /path/to/model
  4. 4運行聊天:COLI_MODEL=/path/to/model ./coli chat
  5. 5(可選)使用網頁 UI 或相容 OpenAI 的伺服器以獲得圖形介面。

colibri 主要功能

  • 純 C 實作,零外部依賴
  • 從磁碟串流專家權重,具備 LRU 快取與可選的固定熱儲存
  • 忠於 GLM-5.2 (glm_moe_dsa) 的前向傳遞,經驗證 token 完全一致
  • MLA 注意力機制,壓縮 KV 快取(體積減少 57 倍)
  • 原生 MTP 推測解碼,每次前向最多產生 2.8 個 token
  • 整數點積核心(int8/int4)搭配 AVX2 加速
  • 線上學習快取,可適應使用模式

colibri 使用情境

  • 在消費級筆電或桌機上運行 744B 參數 MoE 模型
  • 無需雲端依賴的離線聊天與推論
  • 大型 MoE 架構的研究與實驗
  • 在有限硬體上展示前沿模型能力的教育示範

colibri 價格與免費點數

colibri 目前採用 免費 模式。

開源

免費

Apache 2.0 授權。使用或修改無需付費。

colibri 優缺點

優點

  • 在僅 25 GB RAM 的消費級硬體上運行 744B 參數模型
  • 開源且完全透明(C 程式碼,無依賴)
  • 高效的磁碟串流與快取,可長時間使用
  • 活躍的社群基準測試與改進

缺點

  • 冷解碼速度極慢(一般 NVMe 上約 0.05-0.1 tok/s)
  • 轉換後的 int4 模型需要約 370 GB 磁碟空間
  • 僅支援 GLM-5.2 模型(無法靈活切換其他模型)
  • CUDA 後端仍在實驗階段且功能有限

colibri 最適合哪些用途?

  • 希望在本機運行大型模型的開發者
  • 在有限硬體上探索 MoE 架構的 AI 研究人員
  • 無需雲端成本即可體驗前沿模型推論的愛好者

colibri 常見問題

colibri 的免費替代工具

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
discode.ai logo

一個聊天介面,讓您存取超過100個AI模型,自動為您的任務選擇最佳模型,同時追蹤能源使用並保護您的隱私。

免費
Oxlo.ai logo

Oxlo.ai 是一個隱私優先的 AI 推論 API,為超過 45 個開源模型提供按請求計價的方案。

免費
Graphsignal logo

Graphsignal 是一個生產規模的推論剖析平台,協助工程師在各種模型、引擎、GPU 及其他加速器上優化 AI 效能。

免費

colibri 的最佳替代 AI 工具

DwarfStar logo

專為大型語言模型設計的本地推論引擎,針對 Apple Silicon 及記憶體受限系統上的 SSD 串流進行最佳化。

LibArgus logo

統一的零分配原生 AI 推理運行時,適用於 Java,通過 Project Panama 整合 LLM、視覺和語音管道。

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
Auriko logo

一個統一的 API 平台,用於 LLM 推理,具備成本最佳化、路由、可觀測性和自動故障轉移功能。

L

一款基於瀏覽器的工具,運用雅可比透鏡即時讀取語言模型的內部概念。

Frugon logo

Frugon 是一個免費、開源的 LLM 成本分析工具,透過本地分析通話記錄,找出你的 LLM 帳單漏洞。