KI Große Sprachmodelle (LLMs)
colibri
Eine ablauffreie C-Engine, die Expertengewichte von der Festplatte streamt, um das 744B-Parameter-Modell GLM-5.2 MoE auf Consumer-Hardware mit nur 25 GB RAM auszuführen.
colibri
Was ist colibri?
colibri ist eine leichte, reine C-Inferenz-Engine für das GLM-5.2 744B-Parameter-Mixture-of-Experts-Modell. Es streamt Expertengewichte von der Festplatte und benötigt zur Laufzeit kein Python, keine GPU und keine externen Abhängigkeiten, wodurch die lokale Ausführung auf einem Rechner mit ~25 GB RAM möglich ist.
colibri vs Ähnliche Tools
| Preismodell | Kostenlos | Kostenlos | Kostenlos | Kostenlos, Freemium |
| Gratis-Credits | ||||
| Wichtige Funktionen |
|
|
|
|
| Vorteile |
|
|
|
|
| Nachteile |
|
|
|
|
| Geeignet für |
|
|
|
|
So nutzt du colibri?
- 1Repository klonen: git clone https://github.com/JustVugg/colibri.git
- 2Engine bauen: cd c && make
- 3Das FP8-Modell in int4 konvertieren: ./coli convert --model /pfad/zum/modell
- 4Chat starten: COLI_MODEL=/pfad/zum/modell ./coli chat
- 5(Optional) Web-UI oder OpenAI-kompatiblen Server für eine grafische Oberfläche nutzen.
colibri Wichtige Funktionen
- Reine C-Implementierung ohne externe Abhängigkeiten
- Streaming von Expertengewichten von der Festplatte mit LRU-Cache und optionalem gepinnten Hot-Store
- Originalgetreuer GLM-5.2 (glm_moe_dsa) Forward-Pass, token-exakt validiert
- MLA-Aufmerksamkeit mit komprimiertem KV-Cache (57x kleiner)
- Natives MTP-spekulatives Decoding für bis zu 2,8 Tokens pro Forward
- Integer-Dot-Kernel (int8/int4) mit AVX2-Beschleunigung
- Online-Lern-Cache, der sich an Nutzungsmuster anpasst
colibri Anwendungsfälle
- Ausführen eines 744B-Parameter-MoE-Modells auf einem Consumer-Laptop oder -Desktop
- Offline-Chat und Inferenz ohne Cloud-Abhängigkeiten
- Forschung und Experimente mit großen MoE-Architekturen
- Bildungsdemonstrationen der Fähigkeiten von Frontier-Modellen auf begrenzter Hardware
colibri Preise und Gratis-Credits
colibri arbeitet mit dem Modell Kostenlos.
colibri Vorteile und Nachteile
Vorteile
- Führt ein 744B-Parameter-Modell auf Consumer-Hardware mit nur 25 GB RAM aus
- Open Source und vollständig transparent (C-Code, keine Abhängigkeiten)
- Effizientes Festplatten-Streaming mit Caching ermöglicht langlaufende Nutzung
- Aktive Community-Benchmarks und Verbesserungen
Nachteile
- Sehr langsame Kalt-Dekodierung (0,05-0,1 Tok/s auf typischer NVMe)
- Erfordert ~370 GB Festplattenspeicher für das konvertierte int4-Modell
- Unterstützt nur das GLM-5.2-Modell (keine Multi-Modell-Flexibilität)
- CUDA-Backend ist experimentell und eingeschränkt
Wofür eignet sich colibri am besten?
- Entwickler, die massive Modelle lokal ausführen möchten
- KI-Forscher, die MoE-Architekturen auf begrenzter Hardware erkunden
- Enthusiasten, die an Frontier-Modell-Inferenz ohne Cloud-Kosten interessiert sind