Grands Modèles Linguistiques IA
colibri
Un moteur C sans dépendances qui diffuse les poids des experts depuis le disque pour exécuter le modèle GLM-5.2 MoE de 744 milliards de paramètres sur du matériel grand public avec seulement 25 Go de RAM.
colibri
Qu’est-ce que colibri?
colibri est un moteur d'inférence léger, en pur C, pour le modèle GLM-5.2 de 744 milliards de paramètres à mélange d'experts (MoE). Il diffuse les poids des experts depuis le disque et ne nécessite ni Python, ni GPU, ni dépendances externes lors de l'exécution, permettant une exécution locale sur une machine avec ~25 Go de RAM.
colibri vs Outils Similaires
| Modèle de Tarification | Gratuit | Gratuit | Gratuit | Gratuit, Freemium |
| Crédits Gratuits | ||||
| Fonctionnalités clés |
|
|
|
|
| Avantages |
|
|
|
|
| Limites |
|
|
|
|
| Idéal pour |
|
|
|
|
Comment utiliser colibri?
- 1Clonez le dépôt : git clone https://github.com/JustVugg/colibri.git
- 2Compilez le moteur : cd c && make
- 3Convertissez le modèle FP8 en int4 : ./coli convert --model /chemin/vers/le/modèle
- 4Lancez le chat : COLI_MODEL=/chemin/vers/le/modèle ./coli chat
- 5(Optionnel) Utilisez l'interface web ou le serveur compatible OpenAI pour une interface graphique.
colibri Fonctionnalités clés
- Implémentation en pur C sans aucune dépendance externe
- Diffusion des poids des experts depuis le disque, avec cache LRU et stockage chaud épinglé optionnel
- Propagation avant fidèle de GLM-5.2 (glm_moe_dsa), validée token-exact
- Attention MLA avec cache KV compressé (57x plus petit)
- Décodage spéculatif MTP natif jusqu'à 2,8 tokens par propagation
- Noyaux de produit scalaire entier (int8/int4) avec accélération AVX2
- Cache d'apprentissage en ligne qui s'adapte aux schémas d'utilisation
colibri Cas d’usage
- Exécuter un modèle MoE de 744 milliards de paramètres sur un ordinateur portable ou de bureau grand public
- Chat et inférence hors ligne sans dépendances cloud
- Recherche et expérimentation avec de grandes architectures MoE
- Démonstrations éducatives des capacités des modèles de pointe sur du matériel limité
colibri Tarifs et crédits gratuits
colibri fonctionne avec le modèle Gratuit.
colibri Avantages et limites
Avantages
- Exécute un modèle de 744 milliards de paramètres sur du matériel grand public avec seulement 25 Go de RAM
- Open source et entièrement transparent (code C, aucune dépendance)
- Diffusion efficace depuis le disque avec mise en cache permet une utilisation prolongée
- Benchmarks et améliorations actifs de la communauté
Limites
- Décodage à froid très lent (0,05-0,1 tok/s sur NVMe typique)
- Nécessite ~370 Go d'espace disque pour le modèle converti en int4
- Ne supporte que le modèle GLM-5.2 (pas de flexibilité multi-modèle)
- Le backend CUDA est expérimental et limité
À quoi colibri convient-il le mieux ?
- Développeurs souhaitant exécuter des modèles massifs localement
- Chercheurs en IA explorant les architectures MoE sur du matériel limité
- Passionnés intéressés par l'inférence de modèles de pointe sans coûts cloud