Model Bahasa Besar AI
colibri
Mesin C tanpa dependensi yang mengalirkan bobot ahli dari disk untuk menjalankan model MoE GLM-5.2 dengan 744 miliar parameter pada perangkat konsumen dengan RAM hanya 25 GB.
colibri
Apa itu colibri?
colibri adalah mesin inferensi ringan berbasis C murni untuk model Mixture-of-Experts GLM-5.2 dengan 744 miliar parameter. Mesin ini mengalirkan bobot ahli dari disk dan tidak memerlukan Python, GPU, atau dependensi eksternal saat runtime, memungkinkan eksekusi lokal pada mesin dengan RAM ~25 GB.
colibri vs Alat Serupa
| Model Harga | Gratis | Gratis | Gratis | Gratis, Freemium |
| Kredit Gratis | ||||
| Fitur utama |
|
|
|
|
| Kelebihan |
|
|
|
|
| Kekurangan |
|
|
|
|
| Cocok untuk |
|
|
|
|
Cara menggunakan colibri?
- 1Klon repositori: git clone https://github.com/JustVugg/colibri.git
- 2Bangun mesin: cd c && make
- 3Konversi model FP8 ke int4: ./coli convert --model /path/to/model
- 4Jalankan chat: COLI_MODEL=/path/to/model ./coli chat
- 5(Opsional) Gunakan UI web atau server yang kompatibel dengan OpenAI untuk antarmuka grafis.
colibri Fitur utama
- Implementasi C murni tanpa dependensi eksternal
- Pengaliran bobot ahli dari disk, dengan cache LRU dan hot-store opsional yang dipasangi pin
- Forward pass GLM-5.2 (glm_moe_dsa) yang setia, divalidasi token-eksak
- Perhatian MLA dengan KV-cache terkompresi (57x lebih kecil)
- Decoding spekulatif MTP asli hingga 2,8 token per forward
- Kernel dot integer (int8/int4) dengan akselerasi AVX2
- Cache pembelajaran online yang beradaptasi dengan pola penggunaan
colibri Contoh penggunaan
- Menjalankan model MoE dengan 744 miliar parameter di laptop atau desktop konsumen
- Obrolan dan inferensi offline tanpa dependensi cloud
- Penelitian dan eksperimen dengan arsitektur MoE besar
- Demonstrasi edukasi tentang kemampuan model frontier di perangkat terbatas
colibri Harga dan kredit gratis
colibri menggunakan model Gratis.
Alat ini sepenuhnya gratis
colibri Kelebihan dan kekurangan
Kelebihan
- Menjalankan model 744 miliar parameter di perangkat konsumen hanya dengan 25 GB RAM
- Sumber terbuka dan sepenuhnya transparan (kode C, tanpa dependensi)
- Streaming disk yang efisien dengan caching memungkinkan penggunaan jangka panjang
- Tolok ukur dan peningkatan komunitas yang aktif
Kekurangan
- Decode dingin yang sangat lambat (0,05-0,1 tok/s pada NVMe biasa)
- Memerlukan ~370 GB ruang disk untuk model int4 yang dikonversi
- Hanya mendukung model GLM-5.2 (tidak ada fleksibilitas multi-model)
- Backend CUDA bersifat eksperimental dan terbatas
colibri paling cocok untuk apa?
- Pengembang yang ingin menjalankan model besar secara lokal
- Peneliti AI yang mengeksplorasi arsitektur MoE di perangkat terbatas
- Penggemar yang tertarik pada inferensi model frontier tanpa biaya cloud