AI Store Språkmodeller

colibri

En uavhengig C-motor som strømmer ekspertvekter fra disk for å kjøre GLM-5.2 MoE-modellen med 744 milliarder parametere på forbruker maskinvare med så lite som 25 GB RAM.

Hva er colibri?

colibri er en lettvekts, ren C-inferansemotor for GLM-5.2 Mixture-of-Experts-modellen med 744 milliarder parametere. Den strømmer ekspertvekter fra disk og krever verken Python, GPU eller eksterne avhengigheter under kjøring, noe som muliggjør lokal kjøring på en maskin med ~25 GB RAM.

colibri vs Lignende Verktøy

PrismodellGratisGratis, FreemiumBetaltBetalt
Gratis kreditter
Viktige funksjoner
  • Ren C-implementering uten eksterne avhengigheter
  • Strømming av ekspertvekter fra disk, med LRU-buffer og valgfri festet hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) foroverpass, validert tokens-eksakt
  • Tilgang til flere AI-modeller (GPT, Claude, Gemini, DeepSeek, Grok, etc.)
  • Teamsamarbeid i private arbeidsområder
  • Støtte for filopplasting (PDF, kode, dokumenter) med kontekstuell forståelse
  • Enkelt modell for alle oppgaver uten modusbytte
  • OpenAI-kompatibelt API
  • Claude Fable-kvalitet på evaluerte oppgaver
  • Ubegrensede tokens
  • Ubegrenset kontekstvindu
  • Flat månedlig prising
Fordeler
  • Kjører en modell med 744 milliarder parametere på forbrukermaskinvare med bare 25 GB RAM
  • Åpen kildekode og fullt transparent (C-kode, ingen avhengigheter)
  • Tilgang til flere ledende AI-modeller på én plattform
  • Innebygde funksjoner for teamsamarbeid
  • Høy kvalitet sammenlignbar med Claude Fable
  • Betydelig lavere kostnad enn frontlinjemodeller
  • Ubegrensede tokens og kontekst
  • Flat, forutsigbar prising
Ulemper
  • Veldig treg kald dekoding (0,05-0,1 tok/s på typisk NVMe)
  • Krever ~370 GB diskplass for den konverterte int4-modellen
  • Begrenset antall meldinger og kreditter på gratisplanen
  • Avanserte funksjoner krever betalt abonnement
  • Nyere modell med begrenset uavhengig validering
  • Eksakt prising er ikke offentlig detaljert
  • Høy månedlig kostnad ($10K+)
  • Krever 14 dagers klargjøring
Passer best for
  • Utviklere som ønsker å kjøre store modeller lokalt
  • AI-forskere som utforsker MoE-arkitekturer på begrenset maskinvare
  • Team som trenger tilgang til ulike AI-modeller
  • Innholdsskapere og forskere
  • Utviklere som søker høy kvalitet LLM til lavere kostnad
  • Team som trenger en enkelt allsidig modell
  • Bedriftsteam som kjører AI-agenter i stor skala
  • Programvareutviklingsteam som trenger langhorisont-kodegenerering

Slik bruker du colibri?

  1. 1Klon repositoriet: git clone https://github.com/JustVugg/colibri.git
  2. 2Bygg motoren: cd c && make
  3. 3Konverter FP8-modellen til int4: ./coli convert --model /path/to/model
  4. 4Kjør chat: COLI_MODEL=/path/to/model ./coli chat
  5. 5(Valgfritt) Bruk webgrensesnittet eller OpenAI-kompatibel server for et grafisk grensesnitt.

colibri Viktige funksjoner

  • Ren C-implementering uten eksterne avhengigheter
  • Strømming av ekspertvekter fra disk, med LRU-buffer og valgfri festet hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) foroverpass, validert tokens-eksakt
  • MLA-oppmerksomhet med komprimert KV-buffer (57x mindre)
  • Innebygd MTP spekulativ dekoding for opptil 2.8 tokens per fremover
  • Heltall-dot-kjerner (int8/int4) med AVX2-akselerasjon
  • Online læringsbuffer som tilpasser seg bruksmønstre

colibri Bruksområder

  • Kjøre en MoE-modell med 744 milliarder parametere på en forbruker bærbar eller stasjonær PC
  • Offline chat og inferanse uten skyavhengigheter
  • Forskning og eksperimentering med store MoE-arkitekturer
  • Pedagogiske demonstrasjoner av frontmodellens muligheter på begrenset maskinvare

colibri Priser og gratiskreditter

colibri bruker prismodellen Gratis.

Dette verktøyet er helt gratis

Åpen kildekode

Gratis

Apache 2.0-lisens. Ingen kostnad for bruk eller modifikasjon.

colibri Fordeler og ulemper

Fordeler

  • Kjører en modell med 744 milliarder parametere på forbrukermaskinvare med bare 25 GB RAM
  • Åpen kildekode og fullt transparent (C-kode, ingen avhengigheter)
  • Effektiv diskstrømming med bufring muliggjør langvarig bruk
  • Aktivt fellesskap for benchmarks og forbedringer

Ulemper

  • Veldig treg kald dekoding (0,05-0,1 tok/s på typisk NVMe)
  • Krever ~370 GB diskplass for den konverterte int4-modellen
  • Støtter kun GLM-5.2-modell (ingen multi-modell fleksibilitet)
  • CUDA-backend er eksperimentell og begrenset

Hva passer colibri best til?

  • Utviklere som ønsker å kjøre store modeller lokalt
  • AI-forskere som utforsker MoE-arkitekturer på begrenset maskinvare
  • Entusiaster interessert i frontmodell inferanse uten skykostnader

Vanlige spørsmål om colibri

Gratis alternativer til colibri

Opper AI logo

En enhetlig AI-gateway som gir tilgang til over 300 ledende modeller gjennom ett EU-hostet, GDPR-kompatibelt API med et OpenAI SDK-kompatibelt grensesnitt.

Gratis
discode.ai logo

Ett chattegrensesnitt som gir deg tilgang til over 100 AI-modeller, velger automatisk den beste modellen for oppgaven din, samtidig som den sporer energibruk og beskytter personvernet ditt.

Gratis
Oxlo.ai logo

Oxlo.ai er et personvernfokusert AI-inferens-API som tilbyr forespørselsbasert prising for over 45 åpne modeller.

Gratis
Graphsignal logo

Graphsignal er en produksjonsskala inferensprofileringsplattform som hjelper ingeniører med å optimalisere AI-ytelse på tvers av modeller, motorer, GPUer og andre akseleratorer.

Gratis

Beste AI-alternativer til colibri

Aymo AI logo

Alt-i-ett AI-plattform for team som gir tilgang til ledende AI-modeller som GPT, Claude, Gemini og mer i et sikkert samarbeidsområde.

EB

Echo er en åpen vekt AI-modell som gir Claude-klasse ytelse til en tredjedel av kostnaden, tilpasset chat-, kode- og agentoppgaver.

L

LiquidBrain.ai tilbyr ubegrenset token- og kontekst-AI-inferens på en fast månedlig regning, ved hjelp av en patentert distribuert inferensmotor for privat, skalerbar modellutrulling.

DwarfStar logo

En spesialisert lokal inferensmotor for store språkmodeller, optimalisert for Apple Silicon og SSD-strømming på minnebegrensede systemer.

LibArgus logo

Enhetlig, null-allokeringsbasert innfødt AI-inferenskjøretid for Java, som konsoliderer LLM-, syn- og talepipelines via Project Panama.

Opper AI logo

En enhetlig AI-gateway som gir tilgang til over 300 ledende modeller gjennom ett EU-hostet, GDPR-kompatibelt API med et OpenAI SDK-kompatibelt grensesnitt.

Gratis
Auriko logo

En enhetlig API-plattform for LLM-inferens med kostnadsoptimalisering, ruting, observerbarhet og automatisk failover.