AI大規模言語モデル (LLM)
colibri
依存関係のないCエンジンで、ディスクからエキスパート重みをストリーミングし、わずか25GBのRAMで消費者向けハードウェア上で744BパラメータのGLM-5.2 MoEモデルを実行します。
colibri
colibriとは
colibriは、GLM-5.2 744BパラメータのMixture-of-Expertsモデル向けの軽量で純粋なC推論エンジンです。ディスクからエキスパート重みをストリーミングし、ランタイムにPython、GPU、外部依存関係を必要とせず、約25GBのRAMを搭載したマシンでローカル実行を可能にします。
colibriと類似AIツールの比較
| 料金モデル | 無料 | 無料 | 無料 | 無料, フリーミアム |
| 無料クレジット | ||||
| 主な機能 |
|
|
|
|
| メリット |
|
|
|
|
| 注意点 |
|
|
|
|
| おすすめの人 |
|
|
|
|
colibriの使い方
- 1リポジトリをクローン: git clone https://github.com/JustVugg/colibri.git
- 2エンジンをビルド: cd c && make
- 3FP8モデルをint4に変換: ./coli convert --model /path/to/model
- 4チャットを実行: COLI_MODEL=/path/to/model ./coli chat
- 5(オプション) Web UIまたはOpenAI互換サーバーを使用してグラフィカルインターフェースを利用。
colibriの主な機能
- 純粋なC実装で外部依存関係ゼロ
- ディスクからのエキスパート重みのストリーミング、LRUキャッシュとオプションのピン留めホットストア
- 忠実なGLM-5.2 (glm_moe_dsa) フォワードパス、トークン単位で検証済み
- 圧縮KVキャッシュを備えたMLAアテンション(57倍小さい)
- ネイティブMTP投機的デコード、1フォワードあたり最大2.8トークン
- AVX2アクセラレーション対応の整数ドットカーネル(int8/int4)
- 使用パターンに適応するオンライン学習キャッシュ
colibriのユースケース
- 消費者向けラップトップまたはデスクトップで744BパラメータMoEモデルを実行
- クラウド依存なしのオフラインチャットと推論
- 大規模MoEアーキテクチャの研究と実験
- 限られたハードウェアでの最先端モデル機能の教育デモンストレーション
colibriの料金と無料枠
colibri の料金モデルは 無料 です。
このツールは完全に無料で利用できます
colibriのメリット・注意点
メリット
- わずか25GBのRAMで消費者向けハードウェア上で744Bパラメータモデルを実行
- オープンソースで完全に透明(Cコード、依存関係なし)
- キャッシュを備えた効率的なディスクストリーミングにより長時間の使用が可能
- 活発なコミュニティのベンチマークと改善
注意点
- コールドデコードが非常に遅い(一般的なNVMeで0.05-0.1トークン/秒)
- 変換後のint4モデルに約370GBのディスク容量が必要
- GLM-5.2モデルのみサポート(マルチモデル対応なし)
- CUDAバックエンドは実験的で限定的
colibri はどんな用途に向いていますか?
- 大規模モデルをローカルで実行したい開発者
- 限られたハードウェアでMoEアーキテクチャを探求するAI研究者
- クラウドコストなしで最先端モデル推論に興味のある愛好家