AI Store Sprogmodeller
colibri
En afhængighedsfri C-motor, der streamer ekspertvægte fra disk for at køre GLM-5.2 MoE-modellen med 744B parametre på forbrugerhardware med så lidt som 25 GB RAM.
colibri
Hvad er colibri?
colibri er en letvægts, ren C-inferensmotor til GLM-5.2 744B-parameter Mixture-of-Experts-modellen. Den streamer ekspertvægte fra disk og kræver ingen Python, GPU eller eksterne afhængigheder ved kørsel, hvilket muliggør lokal udførelse på en maskine med ~25 GB RAM.
colibri vs Lignende Værktøjer
| Prismodel | Gratis | Gratis | Gratis | Gratis, Freemium |
| Gratis credits | ||||
| Vigtige funktioner |
|
|
|
|
| Fordele |
|
|
|
|
| Ulemper |
|
|
|
|
| Bedst til |
|
|
|
|
Sådan bruger du colibri?
- 1Klon repository: git clone https://github.com/JustVugg/colibri.git
- 2Byg motoren: cd c && make
- 3Konverter FP8-modellen til int4: ./coli convert --model /sti/til/model
- 4Kør chat: COLI_MODEL=/sti/til/model ./coli chat
- 5(Valgfrit) Brug web-UI'et eller OpenAI-kompatibel server for en grafisk grænseflade.
colibri Vigtige funktioner
- Ren C-implementering uden eksterne afhængigheder
- Streaming af ekspertvægte fra disk med LRU-cache og valgfri fast hot-store
- Trofast GLM-5.2 (glm_moe_dsa) fremadpassage, valideret token-eksakt
- MLA-opmærksomhed med komprimeret KV-cache (57x mindre)
- Indbygget MTP spekulativ afkodning op til 2,8 tokens per fremadpassage
- Integer-dot-kerner (int8/int4) med AVX2-acceleration
- Online læringscache, der tilpasser sig brugsmønstre
colibri Brugssituationer
- Kørsel af en 744B-parameter MoE-model på en forbrugerbærbar eller -stationær
- Offline chat og inferens uden skyafhængigheder
- Forskning og eksperimentering med store MoE-arkitekturer
- Uddannelsesmæssige demonstrationer af frontlinjemodelkapaciteter på begrænset hardware
colibri Priser og gratis credits
colibri bruger modellen Gratis.
Dette værktøj er helt gratis
colibri Fordele og ulemper
Fordele
- Kører en 744B-parametermodel på forbrugerhardware med kun 25 GB RAM
- Open source og fuldt transparent (C-kode, ingen afhængigheder)
- Effektiv diskstreaming med caching muliggør langvarig brug
- Aktivt fællesskab med benchmarks og forbedringer
Ulemper
- Meget langsom kold afkodning (0,05-0,1 tok/s på typisk NVMe)
- Kræver ~370 GB diskplads til den konverterede int4-model
- Understøtter kun GLM-5.2-modellen (ingen multi-model fleksibilitet)
- CUDA-backend er eksperimentel og begrænset
Hvad er colibri bedst til?
- Udviklere, der ønsker at køre massive modeller lokalt
- AI-forskere, der udforsker MoE-arkitekturer på begrænset hardware
- Entusiaster interesseret i frontlinjemodelinferens uden skyomkostninger