Yapay Zeka Büyük Dil Modelleri
colibri
Bağımlılıksız bir C motoru; 744B parametreli GLM-5.2 MoE modelini tüketici donanımında en az 25 GB RAM ile çalıştırmak için diskten uzman ağırlıklarını akışla aktarır.
colibri
Nedir colibri?
colibri, GLM-5.2 744B parametreli Uzman Karışımı modeli için hafif, saf C ile yazılmış bir çıkarım motorudur. Diskten uzman ağırlıklarını akışla aktarır ve çalışma zamanında Python, GPU veya harici bağımlılık gerektirmez, böylece ~25 GB RAM'e sahip bir makinede yerel çalıştırmaya olanak tanır.
colibri vs Benzer Araçlar
| Fiyatlandırma Modeli | Ücretsiz | Ücretsiz | Ücretsiz | Ücretsiz, Freemium |
| Ücretsiz Krediler | ||||
| Temel özellikler |
|
|
|
|
| Artılar |
|
|
|
|
| Eksiler |
|
|
|
|
| Kimler için uygun |
|
|
|
|
Nasıl kullanılır colibri?
- 1Depoyu klonlayın: git clone https://github.com/JustVugg/colibri.git
- 2Motoru derleyin: cd c && make
- 3FP8 modelini int4'e dönüştürün: ./coli convert --model /path/to/model
- 4Sohbeti başlatın: COLI_MODEL=/path/to/model ./coli chat
- 5(İsteğe bağlı) Grafik arayüz için web UI veya OpenAI uyumlu sunucuyu kullanın.
colibri Temel özellikler
- Sıfır harici bağımlılıkla saf C uygulaması
- Diskten uzman ağırlıklarının akışla aktarımı, LRU önbellek ve isteğe bağlı sabit sıcak depo
- GLM-5.2 (glm_moe_dsa) ileri geçişi, token bazında doğrulanmış
- Sıkıştırılmış KV önbellek ile MLA dikkat (57 kat daha küçük)
- İleri geçiş başına 2,8 token'a kadar yerel MTP spekülatif kod çözme
- AVX2 hızlandırmalı tamsayı nokta çekirdekleri (int8/int4)
- Kullanım desenlerine uyum sağlayan çevrimiçi öğrenme önbelleği
colibri Kullanım senaryoları
- Tüketici dizüstü veya masaüstü bilgisayarda 744B parametreli MoE modeli çalıştırma
- Bulut bağımlılığı olmadan çevrimdışı sohbet ve çıkarım
- Büyük MoE mimarileri ile araştırma ve deney yapma
- Sınırlı donanımda sınır model yeteneklerinin eğitim amaçlı gösterimi
colibri Fiyatlar ve ücretsiz krediler
colibri, Ücretsiz modeliyle çalışır.
colibri Artılar ve eksiler
Artılar
- Sadece 25 GB RAM ile tüketici donanımında 744B parametreli model çalıştırır
- Açık kaynak ve tamamen şeffaf (C kodu, bağımlılık yok)
- Önbellekleme ile verimli disk akışı uzun süreli kullanım sağlar
- Aktif topluluk kıyaslamaları ve iyileştirmeleri
Eksiler
- Çok yavaş soğuk kod çözme (tipik NVMe'de 0,05-0,1 tok/s)
- Dönüştürülmüş int4 modeli için ~370 GB disk alanı gerektirir
- Yalnızca GLM-5.2 modelini destekler (çoklu model esnekliği yok)
- CUDA arka ucu deneysel ve sınırlıdır
colibri en çok ne için uygundur?
- Devasa modelleri yerel olarak çalıştırmak isteyen geliştiriciler
- Sınırlı donanımda MoE mimarilerini keşfeden yapay zeka araştırmacıları
- Bulut maliyeti olmadan sınır model çıkarımıyla ilgilenen meraklılar