Duże Modele Językowe AI

colibri

Silnik C bez zależności, który strumieniuje wagi ekspertów z dysku, aby uruchomić model GLM-5.2 MoE z 744 miliardami parametrów na sprzęcie konsumenckim przy zaledwie 25 GB RAM.

Czym jest colibri?

colibri to lekki, czysty silnik inferencyjny w C dla modelu GLM-5.2 z 744 miliardami parametrów (Mixture-of-Experts). Strumieniuje wagi ekspertów z dysku i nie wymaga Pythona, GPU ani zewnętrznych zależności w czasie wykonywania, umożliwiając lokalne uruchomienie na maszynie z ~25 GB RAM.

colibri vs Podobne Narzędzia

Model CenDarmoweDarmoweDarmoweDarmowe, Freemium
Darmowe kredyty
Najważniejsze funkcje
  • Implementacja w czystym C bez żadnych zależności zewnętrznych
  • Strumieniowanie wag ekspertów z dysku z pamięcią podręczną LRU i opcjonalnym przypiętym hot-store
  • Wierne przejście w przód GLM-5.2 (glm_moe_dsa), zweryfikowane token-exact
  • Natywne ładowanie modeli DeepSeek V4, Qwen3.6 i GLM 5.2
  • Adaptacyjne zarządzanie pamięcią Metal i strumieniowanie SSD dla systemów z ograniczoną pamięcią
  • Serwer HTTP z wywoływaniem narzędzi i agentem kodowania
  • Bezalokacyjne wnioskowanie za pomocą API Panama FFM
  • Zunifikowane środowisko uruchomieniowe dla modeli LLM, ASR, TTS i multimodalnych
  • Globalny backend procesu eliminujący fragmentację VRAM
  • Ujednolicony dostęp do ponad 300 modeli AI przez jedno API
  • Punkt końcowy kompatybilny z OpenAI SDK
  • Infrastruktura hostowana w UE i zgodna z RODO
Plusy
  • Uruchamia model z 744 miliardami parametrów na sprzęcie konsumenckim przy zaledwie 25 GB RAM
  • Otwarte źródła i w pełni przejrzysty (kod w C, brak zależności)
  • Działa w całości lokalnie, zapewniając prywatność danych
  • Zoptymalizowany dla Apple Silicon z akceleracją Metal
  • Konstrukcja bez alokacji dla wysokiej wydajności w Javie
  • Zunifikowane API dla wielu typów modeli (tekst, wizja, dźwięk)
  • Dostęp do ponad 300 modeli przez jedno API
  • Hostowane w UE i zgodne z RODO, idealne dla europejskich firm
Minusy
  • Bardzo wolny zimny dekod (0.05-0.1 tok/s na typowym dysku NVMe)
  • Wymaga ~370 GB miejsca na dysku dla przekonwertowanego modelu int4
  • Zaprojektowany głównie dla Apple Silicon; backandy CUDA/ROCm są drugorzędne
  • Nie jest uniwersalnym narzędziem do GGUF; obsługuje tylko konkretne modele
  • Wymaga Java 22+ i Project Panama (jeszcze nie standardowe we wszystkich JVM)
  • Proces budowania może być skomplikowany dla początkujących ze względu na kompilację natywną
  • Cennik nie w pełni przejrzysty bez konta
  • Opłata 3% przy zakupie kredytów może być ukrytym kosztem
Najlepsze dla
  • Deweloperzy chcący uruchamiać ogromne modele lokalnie
  • Badacze AI eksplorujący architektury MoE na ograniczonym sprzęcie
  • Użytkownicy komputerów Mac z Apple Silicon chcący lokalnego wnioskowania LLM
  • Programiści poszukujący wyspecjalizowanego, wydajnego silnika wnioskowania
  • Programiści Java budujący aplikacje AI z niskim narzutem pamięci
  • Projekty wymagające lokalnego wnioskowania o wysokiej przepustowości dla modeli LLM i multimodalnych
  • Programiści potrzebujący dostępu do wielu modeli z zgodnością z UE
  • Zespoły budujące agentów AI i aplikacje

Jak używać colibri?

  1. 1Sklonuj repozytorium: git clone https://github.com/JustVugg/colibri.git
  2. 2Zbuduj silnik: cd c && make
  3. 3Konwertuj model FP8 na int4: ./coli convert --model /path/to/model
  4. 4Uruchom czat: COLI_MODEL=/path/to/model ./coli chat
  5. 5(Opcjonalnie) Użyj interfejsu webowego lub serwera kompatybilnego z OpenAI dla interfejsu graficznego.

colibri Najważniejsze funkcje

  • Implementacja w czystym C bez żadnych zależności zewnętrznych
  • Strumieniowanie wag ekspertów z dysku z pamięcią podręczną LRU i opcjonalnym przypiętym hot-store
  • Wierne przejście w przód GLM-5.2 (glm_moe_dsa), zweryfikowane token-exact
  • Uwaga MLA ze skompresowaną pamięcią podręczną KV (57 razy mniejsza)
  • Natywne spekulacyjne dekodowanie MTP dla do 2.8 tokenów na przejście
  • Jądra iloczynu skalarnego (int8/int4) z akceleracją AVX2
  • Pamięć podręczna z uczeniem się online, dostosowująca się do wzorców użycia

colibri Zastosowania

  • Uruchamianie modelu MoE z 744 miliardami parametrów na konsumenckim laptopie lub komputerze stacjonarnym
  • Czat offline i inferencja bez zależności od chmury
  • Badania i eksperymenty z dużymi architekturami MoE
  • Demonstracje edukacyjne możliwości modeli granicznych na ograniczonym sprzęcie

colibri Ceny i darmowe kredyty

colibri działa w modelu Darmowe.

Open Source

Darmowa

Licencja Apache 2.0. Bezpłatny do użytku i modyfikacji.

colibri Plusy i minusy

Plusy

  • Uruchamia model z 744 miliardami parametrów na sprzęcie konsumenckim przy zaledwie 25 GB RAM
  • Otwarte źródła i w pełni przejrzysty (kod w C, brak zależności)
  • Wydajne strumieniowanie z dysku z buforowaniem umożliwia długotrwałe użytkowanie
  • Aktywne benchmarki i ulepszenia społeczności

Minusy

  • Bardzo wolny zimny dekod (0.05-0.1 tok/s na typowym dysku NVMe)
  • Wymaga ~370 GB miejsca na dysku dla przekonwertowanego modelu int4
  • Obsługuje tylko model GLM-5.2 (brak elastyczności wielu modeli)
  • CUDA backend jest eksperymentalny i ograniczony

Do czego najlepiej nadaje się colibri?

  • Deweloperzy chcący uruchamiać ogromne modele lokalnie
  • Badacze AI eksplorujący architektury MoE na ograniczonym sprzęcie
  • Entuzjaści zainteresowani inferencją modeli granicznych bez kosztów chmurowych

Najczęstsze pytania o colibri

Darmowe alternatywy dla colibri

Opper AI logo

Zunifikowana bramka AI zapewniająca dostęp do ponad 300 wiodących modeli za pośrednictwem jednego API hostowanego w UE, zgodnego z RODO, z interfejsem kompatybilnym z OpenAI SDK.

Darmowe
discode.ai logo

Jeden interfejs czatu dający dostęp do ponad 100 modeli AI, automatycznie wybierający najlepszy model do zadania, śledzący zużycie energii i chroniący prywatność.

Darmowe
Oxlo.ai logo

Oxlo.ai to stawiający na prywatność API do wnioskowania AI oferujący cennik za żądanie dla ponad 45 modeli open-source.

Darmowe
Graphsignal logo

Graphsignal to platforma profilowania inferencji na skalę produkcyjną, która pomaga inżynierom optymalizować wydajność AI w modelach, silnikach, procesorach graficznych i innych akceleratorach.

Darmowe

Najlepsze alternatywy AI dla colibri

DwarfStar logo

Wyspecjalizowany lokalny silnik wnioskowania dla dużych modeli językowych, zoptymalizowany dla Apple Silicon i strumieniowania SSD w systemach z ograniczoną pamięcią.

Opper AI logo

Zunifikowana bramka AI zapewniająca dostęp do ponad 300 wiodących modeli za pośrednictwem jednego API hostowanego w UE, zgodnego z RODO, z interfejsem kompatybilnym z OpenAI SDK.

Darmowe
Auriko logo

Zunifikowana platforma API do wnioskowania LLM z optymalizacją kosztów, routowaniem, obserwowalnością i automatycznym przełączaniem awaryjnym.

L

Instrument przeglądarkowy wykorzystujący soczewkę Jacobiego do odczytywania wewnętrznych koncepcji modelu językowego w czasie rzeczywistym.

Frugon logo

Frugon to darmowy, otwartoźródłowy analizator kosztów LLM, który identyfikuje wycieki w rachunku za LLM, analizując lokalnie dzienniki połączeń.