AI Store Språkmodeller

colibri

En uavhengig C-motor som strømmer ekspertvekter fra disk for å kjøre GLM-5.2 MoE-modellen med 744 milliarder parametere på forbruker maskinvare med så lite som 25 GB RAM.

Hva er colibri?

colibri er en lettvekts, ren C-inferansemotor for GLM-5.2 Mixture-of-Experts-modellen med 744 milliarder parametere. Den strømmer ekspertvekter fra disk og krever verken Python, GPU eller eksterne avhengigheter under kjøring, noe som muliggjør lokal kjøring på en maskin med ~25 GB RAM.

colibri vs Lignende Verktøy

PrismodellGratisGratisGratisGratis, Freemium
Gratis kreditter
Viktige funksjoner
  • Ren C-implementering uten eksterne avhengigheter
  • Strømming av ekspertvekter fra disk, med LRU-buffer og valgfri festet hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) foroverpass, validert tokens-eksakt
  • Innebygd modelllasting for DeepSeek V4, Qwen3.6 og GLM 5.2
  • Adaptiv Metal-residens og SSD-strømming for minnebegrensede systemer
  • HTTP-server med verktøykalling og kodeagent
  • Null-allokerings inferens med Project Panama FFM API
  • Enhetlig kjøretid for LLM, ASR, TTS og multimodale modeller
  • Prosessglobal backend for å eliminere VRAM-fragmentering
  • Enhetlig tilgang til over 300 AI-modeller via ett API
  • OpenAI SDK-kompatibelt endepunkt
  • EU-hostet og GDPR-kompatibel infrastruktur
Fordeler
  • Kjører en modell med 744 milliarder parametere på forbrukermaskinvare med bare 25 GB RAM
  • Åpen kildekode og fullt transparent (C-kode, ingen avhengigheter)
  • Kjører helt lokalt, noe som sikrer personvern
  • Optimalisert for Apple Silicon med Metal-akselerasjon
  • Null-allokeringsdesign for høy ytelse i Java
  • Enhetlig API på tvers av flere modelltyper (tekst, syn, lyd)
  • Tilgang til over 300 modeller via ett API
  • EU-hostet og GDPR-kompatibelt, ideelt for europeiske selskaper
Ulemper
  • Veldig treg kald dekoding (0,05-0,1 tok/s på typisk NVMe)
  • Krever ~370 GB diskplass for den konverterte int4-modellen
  • Primært designet for Apple Silicon; CUDA/ROCm-bakender er sekundære
  • Ikke en generisk GGUF-kjører; støtter kun spesifikke modeller
  • Krever Java 22+ og Project Panama (enda ikke standard i alle JVM-er)
  • Byggeprosessen kan være kompleks for nybegynnere på grunn av innfødt kompilering
  • Prising er ikke fullt ut gjennomsiktig uten konto
  • 3% gebyr på kredittkjøp kan være en skjult kostnad
Passer best for
  • Utviklere som ønsker å kjøre store modeller lokalt
  • AI-forskere som utforsker MoE-arkitekturer på begrenset maskinvare
  • Apple Silicon Mac-brukere som ønsker LLM-inferens på enheten
  • Utviklere som søker en spesialisert, høyytelses inferensmotor
  • Java-utviklere som bygger AI-applikasjoner med lavt minneforbruk
  • Prosjekter som trenger lokal, høy gjennomstrømning inferens for LLM-er og multimodale modeller
  • Utviklere som trenger tilgang til flere modeller med EU-compliance
  • Team som bygger AI-agenter og applikasjoner

Slik bruker du colibri?

  1. 1Klon repositoriet: git clone https://github.com/JustVugg/colibri.git
  2. 2Bygg motoren: cd c && make
  3. 3Konverter FP8-modellen til int4: ./coli convert --model /path/to/model
  4. 4Kjør chat: COLI_MODEL=/path/to/model ./coli chat
  5. 5(Valgfritt) Bruk webgrensesnittet eller OpenAI-kompatibel server for et grafisk grensesnitt.

colibri Viktige funksjoner

  • Ren C-implementering uten eksterne avhengigheter
  • Strømming av ekspertvekter fra disk, med LRU-buffer og valgfri festet hot-store
  • Trofast GLM-5.2 (glm_moe_dsa) foroverpass, validert tokens-eksakt
  • MLA-oppmerksomhet med komprimert KV-buffer (57x mindre)
  • Innebygd MTP spekulativ dekoding for opptil 2.8 tokens per fremover
  • Heltall-dot-kjerner (int8/int4) med AVX2-akselerasjon
  • Online læringsbuffer som tilpasser seg bruksmønstre

colibri Bruksområder

  • Kjøre en MoE-modell med 744 milliarder parametere på en forbruker bærbar eller stasjonær PC
  • Offline chat og inferanse uten skyavhengigheter
  • Forskning og eksperimentering med store MoE-arkitekturer
  • Pedagogiske demonstrasjoner av frontmodellens muligheter på begrenset maskinvare

colibri Priser og gratiskreditter

colibri bruker prismodellen Gratis.

Dette verktøyet er helt gratis

Åpen kildekode

Gratis

Apache 2.0-lisens. Ingen kostnad for bruk eller modifikasjon.

colibri Fordeler og ulemper

Fordeler

  • Kjører en modell med 744 milliarder parametere på forbrukermaskinvare med bare 25 GB RAM
  • Åpen kildekode og fullt transparent (C-kode, ingen avhengigheter)
  • Effektiv diskstrømming med bufring muliggjør langvarig bruk
  • Aktivt fellesskap for benchmarks og forbedringer

Ulemper

  • Veldig treg kald dekoding (0,05-0,1 tok/s på typisk NVMe)
  • Krever ~370 GB diskplass for den konverterte int4-modellen
  • Støtter kun GLM-5.2-modell (ingen multi-modell fleksibilitet)
  • CUDA-backend er eksperimentell og begrenset

Hva passer colibri best til?

  • Utviklere som ønsker å kjøre store modeller lokalt
  • AI-forskere som utforsker MoE-arkitekturer på begrenset maskinvare
  • Entusiaster interessert i frontmodell inferanse uten skykostnader

Vanlige spørsmål om colibri

Gratis alternativer til colibri

Opper AI logo

En enhetlig AI-gateway som gir tilgang til over 300 ledende modeller gjennom ett EU-hostet, GDPR-kompatibelt API med et OpenAI SDK-kompatibelt grensesnitt.

Gratis
discode.ai logo

Ett chattegrensesnitt som gir deg tilgang til over 100 AI-modeller, velger automatisk den beste modellen for oppgaven din, samtidig som den sporer energibruk og beskytter personvernet ditt.

Gratis
Oxlo.ai logo

Oxlo.ai er et personvernfokusert AI-inferens-API som tilbyr forespørselsbasert prising for over 45 åpne modeller.

Gratis
Graphsignal logo

Graphsignal er en produksjonsskala inferensprofileringsplattform som hjelper ingeniører med å optimalisere AI-ytelse på tvers av modeller, motorer, GPUer og andre akseleratorer.

Gratis

Beste AI-alternativer til colibri

DwarfStar logo

En spesialisert lokal inferensmotor for store språkmodeller, optimalisert for Apple Silicon og SSD-strømming på minnebegrensede systemer.

LibArgus logo

Enhetlig, null-allokeringsbasert innfødt AI-inferenskjøretid for Java, som konsoliderer LLM-, syn- og talepipelines via Project Panama.

Opper AI logo

En enhetlig AI-gateway som gir tilgang til over 300 ledende modeller gjennom ett EU-hostet, GDPR-kompatibelt API med et OpenAI SDK-kompatibelt grensesnitt.

Gratis
Auriko logo

En enhetlig API-plattform for LLM-inferens med kostnadsoptimalisering, ruting, observerbarhet og automatisk failover.

L

Et nettleserbasert verktøy som bruker Jacobian-linsen for å lese språkmodellers interne konsepter i sanntid.

Frugon logo

Frugon er en gratis, åpen kildekode LLM-kostnadsanalysator som identifiserer hvor LLM-regningen lekker ved å analysere anropsloggene dine lokalt.