Grandes Modelos de Linguagem IA

colibri

Um motor C sem dependências que transmite pesos de especialistas do disco para executar o modelo MoE GLM-5.2 de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM.

O que é colibri?

colibri é um motor de inferência leve, puro em C, para o modelo GLM-5.2 de 744B parâmetros (Mixture-of-Experts). Ele transmite pesos de especialistas do disco e não requer Python, GPU ou dependências externas em tempo de execução, permitindo execução local em uma máquina com ~25 GB de RAM.

colibri vs Ferramentas Similares

Modelo de PreçosGrátisGrátisGrátisGrátis, Freemium
Créditos Grátis
Principais recursos
  • Implementação pura em C com zero dependências externas
  • Streaming de pesos de especialistas do disco, com cache LRU e hot-store fixo opcional
  • Forward fiel do GLM-5.2 (glm_moe_dsa), validado token-exato
  • Carregamento nativo de modelos para DeepSeek V4, Qwen3.6 e GLM 5.2
  • Residência Metal adaptativa e streaming SSD para sistemas com memória limitada
  • Servidor HTTP com chamada de ferramentas e agente de codificação
  • Inferência com zero alocação usando API FFM do Project Panama
  • Runtime unificado para modelos LLM, ASR, TTS e multimodais
  • Backend global de processo para eliminar fragmentação de VRAM
  • Acesso unificado a mais de 300 modelos de IA através de uma única API
  • Endpoint compatível com o SDK da OpenAI
  • Infraestrutura hospedada na UE e compatível com GDPR
Prós
  • Executa um modelo de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM
  • Código aberto e totalmente transparente (código C, sem dependências)
  • Executa inteiramente localmente, garantindo privacidade dos dados
  • Otimizado para Apple Silicon com aceleração Metal
  • Design com zero alocação para alto desempenho em Java
  • API unificada em vários tipos de modelo (texto, visão, áudio)
  • Acesse mais de 300 modelos através de uma única API
  • Hospedado na UE e compatível com GDPR, ideal para empresas europeias
Contras
  • Decodificação a frio muito lenta (0,05-0,1 tok/s em NVMe típico)
  • Requer ~370 GB de espaço em disco para o modelo convertido int4
  • Projetado principalmente para Apple Silicon; backends CUDA/ROCm são secundários
  • Não é um executor GGUF genérico; suporta apenas modelos específicos
  • Requer Java 22+ e Project Panama (ainda não padrão em todas as JVMs)
  • Processo de compilação pode ser complexo para iniciantes devido à compilação nativa
  • Preços não totalmente transparentes sem uma conta
  • Taxa de 3% nas compras de créditos pode ser um custo oculto
Melhor para
  • Desenvolvedores que desejam executar modelos massivos localmente
  • Pesquisadores de IA explorando arquiteturas MoE em hardware limitado
  • Usuários de Mac Apple Silicon que desejam inferência LLM no dispositivo
  • Desenvolvedores que buscam um mecanismo de inferência especializado e de alto desempenho
  • Desenvolvedores Java criando aplicações de IA com baixo consumo de memória
  • Projetos que precisam de inferência local de alto throughput para LLMs e modelos multimodais
  • Desenvolvedores que precisam de acesso a múltiplos modelos com conformidade na UE
  • Equipes que constroem agentes e aplicações de IA

Como usar colibri?

  1. 1Clone o repositório: git clone https://github.com/JustVugg/colibri.git
  2. 2Compile o motor: cd c && make
  3. 3Converta o modelo FP8 para int4: ./coli convert --model /caminho/para/modelo
  4. 4Execute o chat: COLI_MODEL=/caminho/para/modelo ./coli chat
  5. 5(Opcional) Use a interface web ou servidor compatível com OpenAI para uma interface gráfica.

colibri Principais recursos

  • Implementação pura em C com zero dependências externas
  • Streaming de pesos de especialistas do disco, com cache LRU e hot-store fixo opcional
  • Forward fiel do GLM-5.2 (glm_moe_dsa), validado token-exato
  • Atenção MLA com cache KV comprimido (57x menor)
  • Decodificação especulativa MTP nativa para até 2,8 tokens por forward
  • Kernels de produto interno (int8/int4) com aceleração AVX2
  • Cache de aprendizado online que se adapta aos padrões de uso

colibri Casos de uso

  • Executar um modelo MoE de 744B parâmetros em um laptop ou desktop consumidor
  • Chat e inferência offline sem dependências de nuvem
  • Pesquisa e experimentação com arquiteturas MoE grandes
  • Demonstrações educacionais de capacidades de modelos de fronteira em hardware limitado

colibri Preços e créditos grátis

colibri funciona no modelo Grátis.

Código Aberto

Grátis

Licença Apache 2.0. Sem custo para uso ou modificação.

colibri Prós e contras

Prós

  • Executa um modelo de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM
  • Código aberto e totalmente transparente (código C, sem dependências)
  • Streaming eficiente de disco com cache permite uso de longa duração
  • Benchmarks e melhorias ativas da comunidade

Contras

  • Decodificação a frio muito lenta (0,05-0,1 tok/s em NVMe típico)
  • Requer ~370 GB de espaço em disco para o modelo convertido int4
  • Suporta apenas o modelo GLM-5.2 (sem flexibilidade multi-modelo)
  • Backend CUDA é experimental e limitado

Para que colibri é melhor?

  • Desenvolvedores que desejam executar modelos massivos localmente
  • Pesquisadores de IA explorando arquiteturas MoE em hardware limitado
  • Entusiastas interessados em inferência de modelos de fronteira sem custos de nuvem

Perguntas frequentes sobre colibri

Alternativas gratuitas ao colibri

Opper AI logo

Um gateway de IA unificado que fornece acesso a mais de 300 modelos líderes através de uma única API hospedada na UE e compatível com GDPR, com interface compatível com o SDK da OpenAI.

Grátis
discode.ai logo

Interface de chat única que dá acesso a mais de 100 modelos de IA, selecionando automaticamente o melhor modelo para sua tarefa enquanto monitora o consumo de energia e protege sua privacidade.

Grátis
Oxlo.ai logo

Oxlo.ai é uma API de inferência de IA focada em privacidade que oferece preços por requisição para mais de 45 modelos de código aberto.

Grátis
Graphsignal logo

Graphsignal é uma plataforma de perfilamento de inferência em escala de produção que ajuda engenheiros a otimizar o desempenho de IA em modelos, mecanismos, GPUs e outros aceleradores.

Grátis
Atlas Cloud logo

Atlas Cloud é uma plataforma de inferência de IA full-modal que oferece uma única API para modelos de chat, imagem, vídeo e áudio.

Grátis

Melhores alternativas de ferramentas IA ao colibri

DwarfStar logo

Um mecanismo de inferência local especializado para grandes modelos de linguagem, otimizado para Apple Silicon e streaming via SSD em sistemas com memória limitada.

Opper AI logo

Um gateway de IA unificado que fornece acesso a mais de 300 modelos líderes através de uma única API hospedada na UE e compatível com GDPR, com interface compatível com o SDK da OpenAI.

Grátis
Auriko logo

Uma plataforma de API unificada para inferência de LLM com otimização de custos, roteamento, observabilidade e failover automático.

L

Um instrumento baseado em navegador que usa a lente Jacobiana para ler conceitos internos de modelos de linguagem em tempo real.

Frugon logo

O Frugon é um analisador de custos de LLM gratuito e de código aberto que identifica onde sua fatura de LLM vaza, analisando seus logs de chamadas localmente.