Modelli Open Source IA
mlx-serve
Esegui qualsiasi LLM localmente sul tuo Mac più velocemente di LM Studio o Ollama, con chat, agenti di codifica, immagini, video e voce, tutto completamente offline e open source.
mlx-serve
Cos’è mlx-serve?
mlx-serve è un'applicazione macOS gratuita e open-source che esegue modelli linguistici di grandi dimensioni (LLM) interamente sul tuo Mac utilizzando il framework MLX di Apple, fornendo un'inferenza più veloce rispetto ad alternative come LM Studio e Ollama. Supporta un'ampia gamma di modelli, tra cui DeepSeek V4 Flash, Gemma 4, Qwen e altri, e offre funzionalità come decodifica speculativa, clonazione vocale, generazione di immagini e sandbox per agenti.
mlx-serve vs Strumenti Simili
| Modello di Prezzo | Gratis | Gratis | Gratis | Gratis |
| Crediti Gratuiti | ||||
| Funzioni principali |
|
|
|
|
| Pro |
|
|
|
|
| Contro |
|
|
|
|
| Ideale per |
|
|
|
|
Come usare mlx-serve?
- 1Scarica l'app MLX Core da GitHub Releases o installala tramite Homebrew.
- 2Avvia l'app e utilizza il Browser dei Modelli per scaricare qualsiasi modello supportato.
- 3Inizia a chattare nell'interfaccia integrata o connetti app esterne tramite l'API compatibile con OpenAI/Anthropic.
- 4Usa il lanciatore ⌃Space per accesso rapido o configura il controllo vocale e il bot Telegram per il controllo remoto.
mlx-serve Funzioni principali
- Inferenza locale su Apple Silicon con accelerazione Metal nativa
- Decodifica speculativa (Prompt Lookup Decoding, modelli drafter, MTP) per una generazione fino a 2x più veloce
- Generazione di immagini (Krea-2-Turbo, FLUX.2) e modifica di foto da istruzioni testuali
- Generazione video (LTX-Video 2.3) con audio sincronizzato e personaggi parlanti
- Clonazione vocale e text-to-speech (Qwen3-TTS) da pochi secondi di audio
- Modalità agente con 10 strumenti integrati (shell, file, ricerca, navigazione, ecc.) e supporto server MCP
- Sandbox per agenti tramite Virtualizzazione Apple per esecuzione isolata dei comandi
- API compatibile con Ollama per sostituzione immediata delle app Ollama
- Integrazione Claude Code per agenti di codifica locali
- Quantizzazione della cache KV e batch continuo per chat multiple simultanee
mlx-serve Casi d’uso
- Esecuzione di LLM locali per assistenza AI privata senza internet
- Sviluppo e test di agenti AI con esecuzione di strumenti in sandbox
- Sostituzione di API cloud per agenti di codifica (Claude Code, Cursor, Continue)
- Generazione di immagini, video e audio su dispositivo per progetti creativi
- Creazione di assistenti AI personalizzati con controllo vocale e pianificazione
mlx-serve Prezzi e crediti gratuiti
mlx-serve usa un modello Gratis.
Questo strumento è completamente gratuito
mlx-serve Pro e contro
Pro
- Più veloce di LM Studio e Ollama su modelli identici
- Completamente locale e privato – nessun dato lascia il tuo Mac
- Supporta un'enorme varietà di modelli (MLX, GGUF, DeepSeek V4 Flash)
- Include generazione e modifica di immagini, video e voce
- Leggero (~4,5 MB) e facile da installare come app Mac nativa
- Integrazione perfetta con strumenti esistenti tramite API OpenAI/Anthropic/Ollama
Contro
- Solo per Mac (richiede Apple Silicon)
- Alcune funzionalità avanzate (es. DeepSeek V4) richiedono molta memoria (96 GB+)
- Nessun supporto integrato per sincronizzazione cloud o multi-dispositivo
Per cosa è più adatto mlx-serve?
- Utenti Mac che desiderano un'AI locale privata e performante
- Sviluppatori che creano agenti AI e assistenti di codifica
- Creatori di contenuti che necessitano di generazione offline di immagini/video/audio
- Persone e organizzazioni attente alla privacy