Grandes Modelos de Lenguaje IA
colibri
Un motor en C sin dependencias que transmite pesos de expertos desde el disco para ejecutar el modelo GLM-5.2 MoE de 744B parámetros en hardware de consumo con tan solo 25 GB de RAM.
colibri
Qué es colibri?
colibri es un motor de inferencia ligero, puro en C para el modelo Mixture-of-Experts GLM-5.2 de 744B parámetros. Transmite pesos de expertos desde el disco y no requiere Python, GPU ni dependencias externas en tiempo de ejecución, lo que permite la ejecución local en una máquina con ~25 GB de RAM.
colibri vs Herramientas Similares
| Modelo de Precios | Gratis | Gratis | Gratis | Gratis, Freemium |
| Créditos Gratis | ||||
| Funciones principales |
|
|
|
|
| Ventajas |
|
|
|
|
| Desventajas |
|
|
|
|
| Ideal para |
|
|
|
|
Cómo usar colibri?
- 1Clone el repositorio: git clone https://github.com/JustVugg/colibri.git
- 2Compile el motor: cd c && make
- 3Convierta el modelo FP8 a int4: ./coli convert --model /ruta/al/modelo
- 4Ejecute el chat: COLI_MODEL=/ruta/al/modelo ./coli chat
- 5(Opcional) Use la interfaz web o el servidor compatible con OpenAI para una interfaz gráfica.
colibri Funciones principales
- Implementación pura en C sin dependencias externas
- Transmisión de pesos de expertos desde el disco, con caché LRU y almacenamiento rápido opcional
- Forward pass fiel de GLM-5.2 (glm_moe_dsa), validado token a token
- Atención MLA con KV-cache comprimido (57 veces más pequeño)
- Decodificación especulativa MTP nativa para hasta 2.8 tokens por forward
- Kernels de producto escalar entero (int8/int4) con aceleración AVX2
- Caché de aprendizaje en línea que se adapta a los patrones de uso
colibri Casos de uso
- Ejecutar un modelo MoE de 744B parámetros en una laptop o escritorio de consumo
- Chat e inferencia sin conexión sin dependencias en la nube
- Investigación y experimentación con arquitecturas MoE grandes
- Demostraciones educativas de capacidades de modelos de frontera en hardware limitado
colibri Precios y créditos gratis
colibri funciona con un modelo Gratis.
Esta herramienta es completamente gratuita
colibri Ventajas y desventajas
Ventajas
- Ejecuta un modelo de 744B parámetros en hardware de consumo con solo 25 GB de RAM
- Código abierto y completamente transparente (código C, sin dependencias)
- Transmisión eficiente desde disco con caché para uso prolongado
- Benchmarks y mejoras activas de la comunidad
Desventajas
- Decodificación en frío muy lenta (0.05-0.1 tok/s en NVMe típico)
- Requiere ~370 GB de espacio en disco para el modelo convertido a int4
- Solo compatible con el modelo GLM-5.2 (sin flexibilidad multi-modelo)
- El backend CUDA es experimental y limitado
¿Para qué es mejor colibri?
- Desarrolladores que desean ejecutar modelos masivos localmente
- Investigadores de IA que exploran arquitecturas MoE en hardware limitado
- Entusiastas interesados en inferencia de modelos de frontera sin costos de nube