AI Store Sprogmodeller

colibri

En afhængighedsfri C-motor, der streamer ekspertvægte fra disk for at køre GLM-5.2 MoE-modellen med 744B parametre på forbrugerhardware med så lidt som 25 GB RAM.

Hvad er colibri?

colibri er en letvægts, ren C-inferensmotor til GLM-5.2 744B-parameter Mixture-of-Experts-modellen. Den streamer ekspertvægte fra disk og kræver ingen Python, GPU eller eksterne afhængigheder ved kørsel, hvilket muliggør lokal udførelse på en maskine med ~25 GB RAM.

colibri vs Lignende Værktøjer

PrismodelGratisGratisGratisGratis, Freemium
Gratis credits
Vigtige funktioner
  • Ren C-implementering uden eksterne afhængigheder
  • Streaming af ekspertvægte fra disk med LRU-cache og valgfri fast hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) fremadpassage, valideret token-eksakt
  • Indbygget modelindlæsning til DeepSeek V4, Qwen3.6 og GLM 5.2
  • Adaptiv Metal-residency og SSD-streaming til hukommelsesbegrænsede systemer
  • HTTP-server med værktøjskald og kodningsagent
  • Inferens med nul-allokering via Project Panama FFM API
  • Unificeret runtime til LLM, ASR, TTS og multimodale modeller
  • Procesglobal backend for at eliminere VRAM-fragmentering
  • Samlet adgang til 300+ AI-modeller via én API
  • OpenAI SDK-kompatibelt endpoint
  • EU-hostet og GDPR-kompatibel infrastruktur
Fordele
  • Kører en 744B-parametermodel på forbrugerhardware med kun 25 GB RAM
  • Open source og fuldt transparent (C-kode, ingen afhængigheder)
  • Kører helt lokalt, hvilket sikrer dataprivatliv
  • Optimeret til Apple Silicon med Metal-acceleration
  • Nul-allokeringsdesign til høj ydeevne i Java
  • Unificeret API på tværs af flere modeltyper (tekst, vision, lyd)
  • Adgang til 300+ modeller gennem en enkelt API
  • EU-hostet og GDPR-kompatibel, ideel til europæiske virksomheder
Ulemper
  • Meget langsom kold afkodning (0,05-0,1 tok/s på typisk NVMe)
  • Kræver ~370 GB diskplads til den konverterede int4-model
  • Primært designet til Apple Silicon; CUDA/ROCm-backends er sekundære
  • Ikke en generisk GGUF-runner; understøtter kun specifikke modeller
  • Kræver Java 22+ og Project Panama (endnu ikke standard i alle JVM'er)
  • Byggeprocessen kan være kompleks for begyndere på grund af native kompilering
  • Priserne ikke fuldt gennemsigtige uden konto
  • 3% gebyr på kreditkøb kan være en skjult omkostning
Bedst til
  • Udviklere, der ønsker at køre massive modeller lokalt
  • AI-forskere, der udforsker MoE-arkitekturer på begrænset hardware
  • Apple Silicon Mac-brugere, der ønsker lokal LLM-inferens
  • Udviklere, der søger en specialiseret, højtydende inferensmotor
  • Java-udviklere, der bygger AI-applikationer med lavt hukommelsesforbrug
  • Projekter, der har brug for on-premise, høj gennemstrømning inferens til LLM'er og multimodale modeller
  • Udviklere, der har brug for adgang til flere modeller med EU-compliance
  • Teams, der bygger AI-agenter og applikationer

Sådan bruger du colibri?

  1. 1Klon repository: git clone https://github.com/JustVugg/colibri.git
  2. 2Byg motoren: cd c && make
  3. 3Konverter FP8-modellen til int4: ./coli convert --model /sti/til/model
  4. 4Kør chat: COLI_MODEL=/sti/til/model ./coli chat
  5. 5(Valgfrit) Brug web-UI'et eller OpenAI-kompatibel server for en grafisk grænseflade.

colibri Vigtige funktioner

  • Ren C-implementering uden eksterne afhængigheder
  • Streaming af ekspertvægte fra disk med LRU-cache og valgfri fast hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) fremadpassage, valideret token-eksakt
  • MLA-opmærksomhed med komprimeret KV-cache (57x mindre)
  • Indbygget MTP spekulativ afkodning op til 2,8 tokens per fremadpassage
  • Integer-dot-kerner (int8/int4) med AVX2-acceleration
  • Online læringscache, der tilpasser sig brugsmønstre

colibri Brugssituationer

  • Kørsel af en 744B-parameter MoE-model på en forbrugerbærbar eller -stationær
  • Offline chat og inferens uden skyafhængigheder
  • Forskning og eksperimentering med store MoE-arkitekturer
  • Uddannelsesmæssige demonstrationer af frontlinjemodelkapaciteter på begrænset hardware

colibri Priser og gratis credits

colibri bruger modellen Gratis.

Dette værktøj er helt gratis

Open Source

Gratis

Apache 2.0-licens. Ingen omkostninger for brug eller ændring.

colibri Fordele og ulemper

Fordele

  • Kører en 744B-parametermodel på forbrugerhardware med kun 25 GB RAM
  • Open source og fuldt transparent (C-kode, ingen afhængigheder)
  • Effektiv diskstreaming med caching muliggør langvarig brug
  • Aktivt fællesskab med benchmarks og forbedringer

Ulemper

  • Meget langsom kold afkodning (0,05-0,1 tok/s på typisk NVMe)
  • Kræver ~370 GB diskplads til den konverterede int4-model
  • Understøtter kun GLM-5.2-modellen (ingen multi-model fleksibilitet)
  • CUDA-backend er eksperimentel og begrænset

Hvad er colibri bedst til?

  • Udviklere, der ønsker at køre massive modeller lokalt
  • AI-forskere, der udforsker MoE-arkitekturer på begrænset hardware
  • Entusiaster interesseret i frontlinjemodelinferens uden skyomkostninger

Ofte stillede spørgsmål om colibri

Gratis alternativer til colibri

Opper AI logo

En samlet AI-gateway, der giver adgang til 300+ førende modeller gennem én EU-hostet, GDPR-kompatibel API med en OpenAI SDK-kompatibel grænseflade.

Gratis
discode.ai logo

Én chatgrænseflade, der giver adgang til over 100 AI-modeller, automatisk vælger den bedste model til din opgave, mens den sporer energiforbrug og beskytter dit privatliv.

Gratis
Oxlo.ai logo

Oxlo.ai er en privatlivsvenlig AI-inferens-API, der tilbyder anmodningsbaseret prissætning for over 45 open-source-modeller.

Gratis
Graphsignal logo

Graphsignal er en produktionsskala inferensprofilering platform, der hjælper ingeniører med at optimere AI-ydeevne på tværs af modeller, maskiner, GPU'er og andre acceleratorer.

Gratis
Atlas Cloud logo

Atlas Cloud er en full-modal AI-inferensplatform, der tilbyder én API til chat-, billede-, video- og lydmodeller.

Gratis

Bedste AI-alternativer til colibri

DwarfStar logo

En specialiseret lokal inferensmotor til store sprogmodeller, optimeret til Apple Silicon og SSD-streaming på hukommelsesbegrænsede systemer.

LibArgus logo

Unificeret, nul-allokerende native AI-inferensruntime til Java, der konsoliderer LLM-, vision- og talepipelines via Project Panama.

Opper AI logo

En samlet AI-gateway, der giver adgang til 300+ førende modeller gennem én EU-hostet, GDPR-kompatibel API med en OpenAI SDK-kompatibel grænseflade.

Gratis
Auriko logo

En samlet API-platform til LLM-inferens med omkostningsoptimering, routing, observerbare funktioner og automatisk failover.

L

Et browserbaseret instrument, der bruger Jacobian-linsen til at læse sprogmodellers interne koncepter i realtid.

Frugon logo

Frugon er en gratis, open-source LLM-omkostningsanalysator, der identificerer, hvor din LLM-regning lækker, ved at analysere dine opkaldslogfiler lokalt.