AI Grote Taalmodellen
colibri
Een afhankelijkheidsvrije C-engine die expertgewichten van schijf streamt om het GLM-5.2 MoE-model met 744 miljard parameters uit te voeren op consumentenhardware met slechts 25 GB RAM.
colibri
Wat is colibri?
colibri is een lichtgewicht, pure-C inferentie-engine voor het GLM-5.2 744B-parameter Mixture-of-Experts-model. Het streamt expertgewichten van schijf en vereist geen Python, GPU of externe afhankelijkheden tijdens runtime, waardoor lokale uitvoering op een machine met ~25 GB RAM mogelijk is.
colibri vs Vergelijkbare Tools
| Prijsmodel | Gratis | Gratis | Gratis | Gratis, Freemium |
| Gratis Credits | ||||
| Belangrijkste functies |
|
|
|
|
| Voordelen |
|
|
|
|
| Nadelen |
|
|
|
|
| Geschikt voor |
|
|
|
|
Hoe gebruik je colibri?
- 1Kloon de repository: git clone https://github.com/JustVugg/colibri.git
- 2Bouw de engine: cd c && make
- 3Converteer het FP8-model naar int4: ./coli convert --model /pad/naar/model
- 4Start chat: COLI_MODEL=/pad/naar/model ./coli chat
- 5(Optioneel) Gebruik de web-UI of OpenAI-compatibele server voor een grafische interface.
colibri Belangrijkste functies
- Pure C-implementatie zonder externe afhankelijkheden
- Streamen van expertgewichten van schijf, met LRU-cache en optionele pinned hot-store
- Getrouwe GLM-5.2 (glm_moe_dsa) forward-pass, validatie token-exact
- MLA-aandacht met gecomprimeerde KV-cache (57x kleiner)
- Native MTP-speculatieve decodering tot 2.8 tokens per forward
- Integer-dot-kernels (int8/int4) met AVX2-versnelling
- Online leercache die zich aanpast aan gebruikspatronen
colibri Gebruikssituaties
- Een 744B-parameter MoE-model draaien op een consumentenlaptop of -desktop
- Offline chat en inferentie zonder cloudafhankelijkheden
- Onderzoek en experimenten met grote MoE-architecturen
- Educatieve demonstraties van geavanceerde modelmogelijkheden op beperkte hardware
colibri Prijzen en gratis credits
colibri werkt met het model Gratis.
Deze tool is volledig gratis
colibri Voor- en nadelen
Voordelen
- Draait een 744B-parametermodel op consumentenhardware met slechts 25 GB RAM
- Open source en volledig transparant (C-code, geen afhankelijkheden)
- Efficiënt schijfstreamen met caching maakt langdurig gebruik mogelijk
- Actieve community-benchmarks en verbeteringen
Nadelen
- Zeer trage koude decodering (0,05-0,1 tok/s op typische NVMe)
- Vereist ~370 GB schijfruimte voor het geconverteerde int4-model
- Ondersteunt alleen GLM-5.2-model (geen multi-model flexibiliteit)
- CUDA-backend is experimenteel en beperkt
Waar is colibri het meest geschikt voor?
- Ontwikkelaars die grote modellen lokaal willen draaien
- AI-onderzoekers die MoE-architecturen verkennen op beperkte hardware
- Liefhebbers die geïnteresseerd zijn in geavanceerde modelinferentie zonder cloudkosten