KI Open-Source-Modelle

mlx-serve

Führen Sie jedes LLM lokal auf Ihrem Mac aus, schneller als LM Studio oder Ollama, mit Chat, Codierungsagenten, Bildern, Videos und Sprache – alles komplett offline und Open Source.

Was ist mlx-serve?

mlx-serve ist eine kostenlose Open-Source-macOS-Anwendung, die große Sprachmodelle (LLMs) vollständig auf Ihrem Mac mit Apples MLX-Framework ausführt und eine schnellere Inferenz als Alternativen wie LM Studio und Ollama bietet. Es unterstützt eine Vielzahl von Modellen, darunter DeepSeek V4 Flash, Gemma 4, Qwen und mehr, und bietet Funktionen wie spekulative Dekodierung, Sprachklonen, Bildgenerierung und Agenten-Sandboxing.

mlx-serve vs Ähnliche Tools

PreismodellKostenlosKostenlosKostenlosKostenlos
Gratis-Credits
Wichtige Funktionen
  • Lokale Inferenz auf Apple Silicon mit nativer Metal-Beschleunigung
  • Spekulative Dekodierung (Prompt Lookup Decoding, Drafter-Modelle, MTP) für bis zu 2x schnellere Generierung
  • Bildgenerierung (Krea-2-Turbo, FLUX.2) und Fotobearbeitung per Textanweisung
  • Lokaler Speicher ohne gehosteten Vector-SaaS erforderlich
  • Semantisches Abrufen über natürlichsprachliche Abfragen
  • Multi-Agenten-sichere gleichzeitige Schreibvorgänge
  • Inferenz mit Null-Allokation über Project Panama FFM API
  • Einheitliche Laufzeit für LLM, ASR, TTS und multimodale Modelle
  • Prozessglobales Backend zur Beseitigung von VRAM-Fragmentierung
  • Lokale KI-Modelle laufen vollständig auf dem Mac
  • Liest, schreibt und führt Dateien aus
  • Autonome Agenten mit Sprachsteuerung
Vorteile
  • Schneller als LM Studio und Ollama bei identischen Modellen
  • Komplett lokal und privat – keine Daten verlassen Ihren Mac
  • Lokal und datenschutzorientiert
  • Semantische Suche nach Bedeutung
  • Null-Allokationsdesign für hohe Leistung in Java
  • Einheitliche API für mehrere Modelltypen (Text, Vision, Audio)
  • Volle Privatsphäre – Daten verlassen nie das Gerät
  • Funktioniert offline ohne Internet
Nachteile
  • Nur Mac (erfordert Apple Silicon)
  • Einige erweiterte Funktionen (z. B. DeepSeek V4) benötigen viel Speicher (96 GB+)
  • Erfordert einen Embedding-API-Dienst (OpenAI-kompatibel)
  • Auf TypeScript/JavaScript-Umgebungen beschränkt
  • Erfordert Java 22+ und Project Panama (noch nicht in allen JVMs Standard)
  • Build-Prozess kann für Anfänger aufgrund nativer Kompilierung komplex sein
  • Erfordert Apple Silicon (M1 oder neuer)
  • Unterstützt nur macOS 15.5+
Geeignet für
  • Mac-Nutzer, die eine private, leistungsstarke lokale KI wünschen
  • Entwickler, die KI-Agenten und Codierungsassistenten erstellen
  • Entwickler, die Multi-Agenten-KI-Systeme erstellen
  • Teams, die einen persistenten, gemeinsam genutzten Agentenspeicher benötigen
  • Java-Entwickler, die KI-Anwendungen mit geringem Speicher-Overhead erstellen
  • Projekte mit On-Premise-Hochdurchsatz-Inferenz für LLMs und multimodale Modelle
  • Datenschutzbewusste Benutzer
  • Entwickler, die mit sensiblen Code arbeiten

So nutzt du mlx-serve?

  1. 1Laden Sie die MLX Core App von GitHub Releases herunter oder installieren Sie sie über Homebrew.
  2. 2Starten Sie die App und verwenden Sie den Modellbrowser, um jedes unterstützte Modell herunterzuladen.
  3. 3Chatten Sie in der integrierten Oberfläche oder verbinden Sie externe Apps über die OpenAI/Anthropic-kompatible API.
  4. 4Verwenden Sie den ⌃Space-Launcher für schnellen Zugriff oder konfigurieren Sie Sprach- und Telegram-Bot für die Fernsteuerung.

mlx-serve Wichtige Funktionen

  • Lokale Inferenz auf Apple Silicon mit nativer Metal-Beschleunigung
  • Spekulative Dekodierung (Prompt Lookup Decoding, Drafter-Modelle, MTP) für bis zu 2x schnellere Generierung
  • Bildgenerierung (Krea-2-Turbo, FLUX.2) und Fotobearbeitung per Textanweisung
  • Videogenerierung (LTX-Video 2.3) mit synchronisiertem Audio und sprechenden Charakteren
  • Sprachklonen und Text-to-Speech (Qwen3-TTS) aus wenigen Sekunden Audio
  • Agentenmodus mit 10 integrierten Werkzeugen (Shell, Datei, Suche, Browser usw.) und MCP-Server-Support
  • Agenten-Sandbox mit Apple Virtualization für isolierte Befehlsausführung
  • Ollama-kompatible API als Ersatz für Ollama-Apps
  • Claude Code-Integration für lokale Codierungsagenten
  • KV-Cache-Quantisierung und kontinuierliches Batching für mehrere gleichzeitige Chats

mlx-serve Anwendungsfälle

  • Ausführen lokaler LLMs für private KI-Assistenz ohne Internet
  • Entwickeln und Testen von KI-Agenten mit sandboxed Werkzeugausführung
  • Ersetzen von Cloud-APIs für Codierungsagenten (Claude Code, Cursor, Continue)
  • Generieren von Bildern, Videos und Audio auf dem Gerät für kreative Projekte
  • Erstellen benutzerdefinierter KI-Assistenten mit Sprachsteuerung und Zeitplanung

mlx-serve Preise und Gratis-Credits

mlx-serve arbeitet mit dem Modell Kostenlos.

Dieses Tool ist vollständig kostenlos

Kostenlos (Open Source)

$0

Voll funktionsfähige MIT-lizenzierte App ohne Nutzungsbeschränkungen oder Abonnements.

mlx-serve Vorteile und Nachteile

Vorteile

  • Schneller als LM Studio und Ollama bei identischen Modellen
  • Komplett lokal und privat – keine Daten verlassen Ihren Mac
  • Unterstützt eine große Auswahl an Modellen (MLX, GGUF, DeepSeek V4 Flash)
  • Enthält Bild-, Video- und Sprachgenerierung sowie Bearbeitung
  • Leicht (~4,5 MB) und einfach als native Mac-App zu installieren
  • Nahtlose Integration mit vorhandenen Tools über OpenAI/Anthropic/Ollama APIs

Nachteile

  • Nur Mac (erfordert Apple Silicon)
  • Einige erweiterte Funktionen (z. B. DeepSeek V4) benötigen viel Speicher (96 GB+)
  • Kein integrierter Cloud-Sync oder Multi-Device-Support

Wofür eignet sich mlx-serve am besten?

  • Mac-Nutzer, die eine private, leistungsstarke lokale KI wünschen
  • Entwickler, die KI-Agenten und Codierungsassistenten erstellen
  • Content-Ersteller, die offline Bild-/Video-/Audiogenerierung benötigen
  • Datenschutzbewusste Einzelpersonen und Organisationen

Häufige Fragen zu mlx-serve

Kostenlose Alternativen zu mlx-serve

Oxlo.ai logo

Oxlo.ai ist eine datenschutzorientierte KI-Inferenz-API, die eine anfragebasierte Preisgestaltung für über 45 Open-Source-Modelle bietet.

Kostenlos
PixaryAI logo

PixaryAI ist ein Online-KI-Video-Generator zum Erstellen von Videos aus Textprompts oder Bildern mit browserbasierten Steuerelementen.

Kostenlos

Beste KI-Alternativen zu mlx-serve

Wolbarg logo

Wolbarg ist ein lokales TypeScript SDK, das geteiltes semantisches Gedächtnis für KI-Agenten mit SQLite oder PostgreSQL bereitstellt.

LibArgus logo

Einheitliche, null-allokierende native KI-Inferenz-Laufzeit für Java, die LLM-, Vision- und Sprach-Pipelines über Project Panama konsolidiert.

Osaurus logo

Osaurus ist ein privater, lokaler KI-Assistent für den Mac, der offene Modelle auf dem Gerät ausführt, mit optionalem Cloud-KI-Zugriff und autonomen Agenten.

Reame logo

Ein schlanker, vollständig getesteter LLM-Inferenzserver, entwickelt für günstige CPU-Hardware, mit persistentem Caching und einer OpenAI-kompatiblen API.

colibri logo

Eine ablauffreie C-Engine, die Expertengewichte von der Festplatte streamt, um das 744B-Parameter-Modell GLM-5.2 MoE auf Consumer-Hardware mit nur 25 GB RAM auszuführen.

Frugon logo

Frugon ist ein kostenloser Open-Source-LLM-Kostenanalysator, der erkennt, wo Ihre LLM-Rechnung undicht ist, indem er Ihre Anrufprotokolle lokal analysiert.

Branchless NCCL Router logo

Ein verzweigungsfreier, jitterfreier Eingangsrouter für 32-GPU-verteilte Mesh-Netzwerke unter Verwendung von JAX/XLA und NCCL.

Skeights logo

Skeights serialisiert trainierte scikit-learn-Modelle in safetensors und JSON und ersetzt unsicheres Pickle durch ein sicheres, überprüfbares Format.