Grandes Modelos de Linguagem IA
colibri
Um motor C sem dependências que transmite pesos de especialistas do disco para executar o modelo MoE GLM-5.2 de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM.
colibri
O que é colibri?
colibri é um motor de inferência leve, puro em C, para o modelo GLM-5.2 de 744B parâmetros (Mixture-of-Experts). Ele transmite pesos de especialistas do disco e não requer Python, GPU ou dependências externas em tempo de execução, permitindo execução local em uma máquina com ~25 GB de RAM.
colibri vs Ferramentas Similares
| Modelo de Preços | Grátis | Grátis | Grátis | Grátis, Freemium |
| Créditos Grátis | ||||
| Principais recursos |
|
|
|
|
| Prós |
|
|
|
|
| Contras |
|
|
|
|
| Melhor para |
|
|
|
|
Como usar colibri?
- 1Clone o repositório: git clone https://github.com/JustVugg/colibri.git
- 2Compile o motor: cd c && make
- 3Converta o modelo FP8 para int4: ./coli convert --model /caminho/para/modelo
- 4Execute o chat: COLI_MODEL=/caminho/para/modelo ./coli chat
- 5(Opcional) Use a interface web ou servidor compatível com OpenAI para uma interface gráfica.
colibri Principais recursos
- Implementação pura em C com zero dependências externas
- Streaming de pesos de especialistas do disco, com cache LRU e hot-store fixo opcional
- Forward fiel do GLM-5.2 (glm_moe_dsa), validado token-exato
- Atenção MLA com cache KV comprimido (57x menor)
- Decodificação especulativa MTP nativa para até 2,8 tokens por forward
- Kernels de produto interno (int8/int4) com aceleração AVX2
- Cache de aprendizado online que se adapta aos padrões de uso
colibri Casos de uso
- Executar um modelo MoE de 744B parâmetros em um laptop ou desktop consumidor
- Chat e inferência offline sem dependências de nuvem
- Pesquisa e experimentação com arquiteturas MoE grandes
- Demonstrações educacionais de capacidades de modelos de fronteira em hardware limitado
colibri Preços e créditos grátis
colibri funciona no modelo Grátis.
colibri Prós e contras
Prós
- Executa um modelo de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM
- Código aberto e totalmente transparente (código C, sem dependências)
- Streaming eficiente de disco com cache permite uso de longa duração
- Benchmarks e melhorias ativas da comunidade
Contras
- Decodificação a frio muito lenta (0,05-0,1 tok/s em NVMe típico)
- Requer ~370 GB de espaço em disco para o modelo convertido int4
- Suporta apenas o modelo GLM-5.2 (sem flexibilidade multi-modelo)
- Backend CUDA é experimental e limitado
Para que colibri é melhor?
- Desenvolvedores que desejam executar modelos massivos localmente
- Pesquisadores de IA explorando arquiteturas MoE em hardware limitado
- Entusiastas interessados em inferência de modelos de fronteira sem custos de nuvem