Grandi Modelli Linguistici IA
colibri
Un motore C senza dipendenze che trasmette i pesi degli esperti dal disco per eseguire il modello GLM-5.2 MoE da 744B parametri su hardware consumer con soli 25 GB di RAM.
colibri
Cos’è colibri?
colibri è un motore di inferenza leggero, puro C per il modello Mixture-of-Experts GLM-5.2 da 744B parametri. Trasmette i pesi degli esperti dal disco e non richiede Python, GPU o dipendenze esterne a runtime, consentendo l'esecuzione locale su una macchina con ~25 GB di RAM.
colibri vs Strumenti Simili
| Modello di Prezzo | Gratis | Gratis | Gratis | Gratis, Freemium |
| Crediti Gratuiti | ||||
| Funzioni principali |
|
|
|
|
| Pro |
|
|
|
|
| Contro |
|
|
|
|
| Ideale per |
|
|
|
|
Come usare colibri?
- 1Clona il repository: git clone https://github.com/JustVugg/colibri.git
- 2Costruisci il motore: cd c && make
- 3Converti il modello FP8 in int4: ./coli convert --model /percorso/del/modello
- 4Avvia la chat: COLI_MODEL=/percorso/del/modello ./coli chat
- 5(Opzionale) Usa l'interfaccia web o il server compatibile con OpenAI per un'interfaccia grafica.
colibri Funzioni principali
- Implementazione in C puro senza dipendenze esterne
- Streaming dei pesi degli esperti dal disco, con cache LRU e hot-store fissato opzionale
- Forward pass fedele di GLM-5.2 (glm_moe_dsa), validato token-esatto
- Attenzione MLA con KV-cache compressa (57x più piccola)
- Decodifica speculativa nativa MTP fino a 2.8 token per forward
- Kernel integer-dot (int8/int4) con accelerazione AVX2
- Cache di apprendimento online che si adatta ai modelli di utilizzo
colibri Casi d’uso
- Esecuzione di un modello MoE da 744B parametri su un laptop o desktop consumer
- Chat e inferenza offline senza dipendenze cloud
- Ricerca e sperimentazione con grandi architetture MoE
- Dimostrazioni educative delle capacità dei modelli avanzati su hardware limitato
colibri Prezzi e crediti gratuiti
colibri usa un modello Gratis.
colibri Pro e contro
Pro
- Esegue un modello da 744B parametri su hardware consumer con soli 25 GB di RAM
- Open source e completamente trasparente (codice C, nessuna dipendenza)
- Streaming efficiente dal disco con caching consente un utilizzo a lungo termine
- Benchmark e miglioramenti attivi della community
Contro
- Decodifica a freddo molto lenta (0.05-0.1 tok/s su NVMe tipico)
- Richiede ~370 GB di spazio su disco per il modello convertito in int4
- Supporta solo il modello GLM-5.2 (nessuna flessibilità multi-modello)
- Il backend CUDA è sperimentale e limitato
Per cosa è più adatto colibri?
- Sviluppatori che vogliono eseguire modelli enormi localmente
- Ricercatori di IA che esplorano architetture MoE su hardware limitato
- Appassionati interessati all'inferenza di modelli avanzati senza costi cloud