Yapay Zeka Büyük Dil Modelleri

colibri

Bağımlılıksız bir C motoru; 744B parametreli GLM-5.2 MoE modelini tüketici donanımında en az 25 GB RAM ile çalıştırmak için diskten uzman ağırlıklarını akışla aktarır.

colibri logo

colibri

Siteyi aç

Nedir colibri?

colibri, GLM-5.2 744B parametreli Uzman Karışımı modeli için hafif, saf C ile yazılmış bir çıkarım motorudur. Diskten uzman ağırlıklarını akışla aktarır ve çalışma zamanında Python, GPU veya harici bağımlılık gerektirmez, böylece ~25 GB RAM'e sahip bir makinede yerel çalıştırmaya olanak tanır.

colibri vs Benzer Araçlar

Fiyatlandırma ModeliÜcretsizÜcretsizÜcretsizÜcretsiz, Freemium
Ücretsiz Krediler
Temel özellikler
  • Sıfır harici bağımlılıkla saf C uygulaması
  • Diskten uzman ağırlıklarının akışla aktarımı, LRU önbellek ve isteğe bağlı sabit sıcak depo
  • GLM-5.2 (glm_moe_dsa) ileri geçişi, token bazında doğrulanmış
  • DeepSeek V4, Qwen3.6 ve GLM 5.2 için yerel model yükleme
  • Bellek kısıtlı sistemler için uyarlanabilir Metal konumlandırma ve SSD akışı
  • Araç çağırma ve kodlama ajanı ile HTTP sunucusu
  • Project Panama FFM API ile sıfır tahsisli çıkarım
  • LLM, ASR, TTS ve çok modlu modeller için birleşik çalışma zamanı
  • VRAM parçalanmasını önlemek için işlem genelinde arka uç
  • 300'den fazla AI modeline tek API ile birleşik erişim
  • OpenAI SDK ile uyumlu uç nokta
  • AB'de barındırılan ve GDPR uyumlu altyapı
Artılar
  • Sadece 25 GB RAM ile tüketici donanımında 744B parametreli model çalıştırır
  • Açık kaynak ve tamamen şeffaf (C kodu, bağımlılık yok)
  • Tamamen yerel çalışarak veri gizliliği sağlar
  • Metal hızlandırması ile Apple Silicon için optimize edilmiştir
  • Java'da yüksek performans için sıfır tahsisli tasarım
  • Birden çok model türü (metin, görüntü, ses) için birleşik API
  • Tek bir API ile 300'den fazla modele erişim
  • AB'de barındırılan ve GDPR uyumlu, Avrupa şirketleri için ideal
Eksiler
  • Çok yavaş soğuk kod çözme (tipik NVMe'de 0,05-0,1 tok/s)
  • Dönüştürülmüş int4 modeli için ~370 GB disk alanı gerektirir
  • Öncelikle Apple Silicon için tasarlanmıştır; CUDA/ROCm arka uçları ikincildir
  • Genel bir GGUF çalıştırıcı değildir; yalnızca belirli modelleri destekler
  • Java 22+ ve Project Panama gerektirir (henüz tüm JVM'lerde standart değil)
  • Yerel derleme nedeniyle yeni başlayanlar için derleme süreci karmaşık olabilir
  • Hesap olmadan fiyatlandırma tam olarak şeffaf değil
  • Kredi satın alımlarında %3 ücret gizli maliyet olabilir
Kimler için uygun
  • Devasa modelleri yerel olarak çalıştırmak isteyen geliştiriciler
  • Sınırlı donanımda MoE mimarilerini keşfeden yapay zeka araştırmacıları
  • Cihaz üzerinde LLM çıkarımı isteyen Apple Silicon Mac kullanıcıları
  • Özel, yüksek performanslı bir çıkarım motoru arayan geliştiriciler
  • Düşük bellek yüküyle AI uygulamaları oluşturan Java geliştiricileri
  • LLM'ler ve çok modlu modeller için şirket içi, yüksek verimli çıkarım gerektiren projeler
  • AB uyumluluğu ile çoklu model erişimine ihtiyaç duyan geliştiriciler
  • AI ajanları ve uygulamaları oluşturan ekipler

Nasıl kullanılır colibri?

  1. 1Depoyu klonlayın: git clone https://github.com/JustVugg/colibri.git
  2. 2Motoru derleyin: cd c && make
  3. 3FP8 modelini int4'e dönüştürün: ./coli convert --model /path/to/model
  4. 4Sohbeti başlatın: COLI_MODEL=/path/to/model ./coli chat
  5. 5(İsteğe bağlı) Grafik arayüz için web UI veya OpenAI uyumlu sunucuyu kullanın.

colibri Temel özellikler

  • Sıfır harici bağımlılıkla saf C uygulaması
  • Diskten uzman ağırlıklarının akışla aktarımı, LRU önbellek ve isteğe bağlı sabit sıcak depo
  • GLM-5.2 (glm_moe_dsa) ileri geçişi, token bazında doğrulanmış
  • Sıkıştırılmış KV önbellek ile MLA dikkat (57 kat daha küçük)
  • İleri geçiş başına 2,8 token'a kadar yerel MTP spekülatif kod çözme
  • AVX2 hızlandırmalı tamsayı nokta çekirdekleri (int8/int4)
  • Kullanım desenlerine uyum sağlayan çevrimiçi öğrenme önbelleği

colibri Kullanım senaryoları

  • Tüketici dizüstü veya masaüstü bilgisayarda 744B parametreli MoE modeli çalıştırma
  • Bulut bağımlılığı olmadan çevrimdışı sohbet ve çıkarım
  • Büyük MoE mimarileri ile araştırma ve deney yapma
  • Sınırlı donanımda sınır model yeteneklerinin eğitim amaçlı gösterimi

colibri Fiyatlar ve ücretsiz krediler

colibri, Ücretsiz modeliyle çalışır.

Açık Kaynak

Ücretsiz

Apache 2.0 lisansı. Kullanım veya değişiklik için ücret yok.

colibri Artılar ve eksiler

Artılar

  • Sadece 25 GB RAM ile tüketici donanımında 744B parametreli model çalıştırır
  • Açık kaynak ve tamamen şeffaf (C kodu, bağımlılık yok)
  • Önbellekleme ile verimli disk akışı uzun süreli kullanım sağlar
  • Aktif topluluk kıyaslamaları ve iyileştirmeleri

Eksiler

  • Çok yavaş soğuk kod çözme (tipik NVMe'de 0,05-0,1 tok/s)
  • Dönüştürülmüş int4 modeli için ~370 GB disk alanı gerektirir
  • Yalnızca GLM-5.2 modelini destekler (çoklu model esnekliği yok)
  • CUDA arka ucu deneysel ve sınırlıdır

colibri en çok ne için uygundur?

  • Devasa modelleri yerel olarak çalıştırmak isteyen geliştiriciler
  • Sınırlı donanımda MoE mimarilerini keşfeden yapay zeka araştırmacıları
  • Bulut maliyeti olmadan sınır model çıkarımıyla ilgilenen meraklılar

colibri hakkında SSS

colibri için ücretsiz alternatifler

Opper AI logo

300'den fazla lider modele tek bir API ile erişim sağlayan, AB'de barındırılan, GDPR uyumlu ve OpenAI SDK ile uyumlu birleşik bir AI ağ geçidi.

Ücretsiz
discode.ai logo

Tümleşik bir sohbet arayüzü ile 100'den fazla AI modeline erişim sağlar, göreviniz için en iyi modeli otomatik olarak seçer, enerji kullanımını izler ve gizliliğinizi korur.

Ücretsiz
Oxlo.ai logo

Oxlo.ai, 45'ten fazla açık kaynak model için istek tabanlı fiyatlandırma sunan, gizlilik öncelikli bir AI çıkarım API'sidir.

Ücretsiz
Graphsignal logo

Graphsignal, mühendislerin yapay zeka performansını modeller, motorlar, GPU'lar ve diğer hızlandırıcılar arasında optimize etmesine yardımcı olan üretim ölçeğinde bir çıkarım profilleme platformudur.

Ücretsiz

colibri için en iyi AI alternatifleri

DwarfStar logo

Büyük dil modelleri için özel bir yerel çıkarım motoru, Apple Silicon ve bellek kısıtlı sistemlerde SSD akışı için optimize edilmiştir.

Opper AI logo

300'den fazla lider modele tek bir API ile erişim sağlayan, AB'de barındırılan, GDPR uyumlu ve OpenAI SDK ile uyumlu birleşik bir AI ağ geçidi.

Ücretsiz
Auriko logo

Birden çok LLM sağlayıcısına yönelik, maliyet optimizasyonu, yönlendirme, gözlemlenebilirlik ve otomatik yük devretme sunan birleşik bir API platformu.

Frugon logo

Frugon, ücretsiz ve açık kaynaklı bir LLM maliyet analizörüdür. Çağrı kayıtlarınızı yerel olarak analiz ederek LLM faturanızın nereden sızdığını belirler.