AI Store Språkmodeller
colibri
En uavhengig C-motor som strømmer ekspertvekter fra disk for å kjøre GLM-5.2 MoE-modellen med 744 milliarder parametere på forbruker maskinvare med så lite som 25 GB RAM.
colibri
Hva er colibri?
colibri er en lettvekts, ren C-inferansemotor for GLM-5.2 Mixture-of-Experts-modellen med 744 milliarder parametere. Den strømmer ekspertvekter fra disk og krever verken Python, GPU eller eksterne avhengigheter under kjøring, noe som muliggjør lokal kjøring på en maskin med ~25 GB RAM.
colibri vs Lignende Verktøy
| Prismodell | Gratis | Gratis | Gratis | Gratis, Freemium |
| Gratis kreditter | ||||
| Viktige funksjoner |
|
|
|
|
| Fordeler |
|
|
|
|
| Ulemper |
|
|
|
|
| Passer best for |
|
|
|
|
Slik bruker du colibri?
- 1Klon repositoriet: git clone https://github.com/JustVugg/colibri.git
- 2Bygg motoren: cd c && make
- 3Konverter FP8-modellen til int4: ./coli convert --model /path/to/model
- 4Kjør chat: COLI_MODEL=/path/to/model ./coli chat
- 5(Valgfritt) Bruk webgrensesnittet eller OpenAI-kompatibel server for et grafisk grensesnitt.
colibri Viktige funksjoner
- Ren C-implementering uten eksterne avhengigheter
- Strømming av ekspertvekter fra disk, med LRU-buffer og valgfri festet hot-store
- Trofast GLM-5.2 (glm_moe_dsa) foroverpass, validert tokens-eksakt
- MLA-oppmerksomhet med komprimert KV-buffer (57x mindre)
- Innebygd MTP spekulativ dekoding for opptil 2.8 tokens per fremover
- Heltall-dot-kjerner (int8/int4) med AVX2-akselerasjon
- Online læringsbuffer som tilpasser seg bruksmønstre
colibri Bruksområder
- Kjøre en MoE-modell med 744 milliarder parametere på en forbruker bærbar eller stasjonær PC
- Offline chat og inferanse uten skyavhengigheter
- Forskning og eksperimentering med store MoE-arkitekturer
- Pedagogiske demonstrasjoner av frontmodellens muligheter på begrenset maskinvare
colibri Priser og gratiskreditter
colibri bruker prismodellen Gratis.
Dette verktøyet er helt gratis
colibri Fordeler og ulemper
Fordeler
- Kjører en modell med 744 milliarder parametere på forbrukermaskinvare med bare 25 GB RAM
- Åpen kildekode og fullt transparent (C-kode, ingen avhengigheter)
- Effektiv diskstrømming med bufring muliggjør langvarig bruk
- Aktivt fellesskap for benchmarks og forbedringer
Ulemper
- Veldig treg kald dekoding (0,05-0,1 tok/s på typisk NVMe)
- Krever ~370 GB diskplass for den konverterte int4-modellen
- Støtter kun GLM-5.2-modell (ingen multi-modell fleksibilitet)
- CUDA-backend er eksperimentell og begrenset
Hva passer colibri best til?
- Utviklere som ønsker å kjøre store modeller lokalt
- AI-forskere som utforsker MoE-arkitekturer på begrenset maskinvare
- Entusiaster interessert i frontmodell inferanse uten skykostnader