Duże Modele Językowe AI
colibri
Silnik C bez zależności, który strumieniuje wagi ekspertów z dysku, aby uruchomić model GLM-5.2 MoE z 744 miliardami parametrów na sprzęcie konsumenckim przy zaledwie 25 GB RAM.
colibri
Czym jest colibri?
colibri to lekki, czysty silnik inferencyjny w C dla modelu GLM-5.2 z 744 miliardami parametrów (Mixture-of-Experts). Strumieniuje wagi ekspertów z dysku i nie wymaga Pythona, GPU ani zewnętrznych zależności w czasie wykonywania, umożliwiając lokalne uruchomienie na maszynie z ~25 GB RAM.
colibri vs Podobne Narzędzia
| Model Cen | Darmowe | Darmowe | Darmowe | Darmowe, Freemium |
| Darmowe kredyty | ||||
| Najważniejsze funkcje |
|
|
|
|
| Plusy |
|
|
|
|
| Minusy |
|
|
|
|
| Najlepsze dla |
|
|
|
|
Jak używać colibri?
- 1Sklonuj repozytorium: git clone https://github.com/JustVugg/colibri.git
- 2Zbuduj silnik: cd c && make
- 3Konwertuj model FP8 na int4: ./coli convert --model /path/to/model
- 4Uruchom czat: COLI_MODEL=/path/to/model ./coli chat
- 5(Opcjonalnie) Użyj interfejsu webowego lub serwera kompatybilnego z OpenAI dla interfejsu graficznego.
colibri Najważniejsze funkcje
- Implementacja w czystym C bez żadnych zależności zewnętrznych
- Strumieniowanie wag ekspertów z dysku z pamięcią podręczną LRU i opcjonalnym przypiętym hot-store
- Wierne przejście w przód GLM-5.2 (glm_moe_dsa), zweryfikowane token-exact
- Uwaga MLA ze skompresowaną pamięcią podręczną KV (57 razy mniejsza)
- Natywne spekulacyjne dekodowanie MTP dla do 2.8 tokenów na przejście
- Jądra iloczynu skalarnego (int8/int4) z akceleracją AVX2
- Pamięć podręczna z uczeniem się online, dostosowująca się do wzorców użycia
colibri Zastosowania
- Uruchamianie modelu MoE z 744 miliardami parametrów na konsumenckim laptopie lub komputerze stacjonarnym
- Czat offline i inferencja bez zależności od chmury
- Badania i eksperymenty z dużymi architekturami MoE
- Demonstracje edukacyjne możliwości modeli granicznych na ograniczonym sprzęcie
colibri Ceny i darmowe kredyty
colibri działa w modelu Darmowe.
colibri Plusy i minusy
Plusy
- Uruchamia model z 744 miliardami parametrów na sprzęcie konsumenckim przy zaledwie 25 GB RAM
- Otwarte źródła i w pełni przejrzysty (kod w C, brak zależności)
- Wydajne strumieniowanie z dysku z buforowaniem umożliwia długotrwałe użytkowanie
- Aktywne benchmarki i ulepszenia społeczności
Minusy
- Bardzo wolny zimny dekod (0.05-0.1 tok/s na typowym dysku NVMe)
- Wymaga ~370 GB miejsca na dysku dla przekonwertowanego modelu int4
- Obsługuje tylko model GLM-5.2 (brak elastyczności wielu modeli)
- CUDA backend jest eksperymentalny i ograniczony
Do czego najlepiej nadaje się colibri?
- Deweloperzy chcący uruchamiać ogromne modele lokalnie
- Badacze AI eksplorujący architektury MoE na ograniczonym sprzęcie
- Entuzjaści zainteresowani inferencją modeli granicznych bez kosztów chmurowych