Modelos de Código Aberto IA
mlx-serve
Execute qualquer LLM localmente no seu Mac mais rápido que o LM Studio ou Ollama, com chat, agentes de codificação, imagens, vídeo e voz, tudo totalmente offline e de código aberto.
mlx-serve
O que é mlx-serve?
O mlx-serve é um aplicativo gratuito e de código aberto para macOS que executa modelos de linguagem grandes (LLMs) inteiramente no seu Mac usando o framework MLX da Apple, oferecendo inferência mais rápida que alternativas como LM Studio e Ollama. Suporta uma vasta gama de modelos, incluindo DeepSeek V4 Flash, Gemma 4, Qwen e outros, e oferece funcionalidades como decodificação especulativa, clonagem de voz, geração de imagens e sandbox de agentes.
mlx-serve vs Ferramentas Similares
| Modelo de Preços | Grátis | Grátis | Grátis | Grátis |
| Créditos Grátis | ||||
| Principais recursos |
|
|
|
|
| Prós |
|
|
|
|
| Contras |
|
|
|
|
| Melhor para |
|
|
|
|
Como usar mlx-serve?
- 1Baixe o aplicativo MLX Core a partir dos GitHub Releases ou instale via Homebrew.
- 2Inicie o aplicativo e use o Navegador de Modelos para baixar qualquer modelo suportado.
- 3Comece a conversar na interface integrada ou conecte aplicativos externos através da API compatível com OpenAI/Anthropic.
- 4Use o lançador ⌃Space para acesso rápido, ou configure o bot de voz e Telegram para controle remoto.
mlx-serve Principais recursos
- Inferência local no Apple Silicon com aceleração nativa Metal
- Decodificação especulativa (Prompt Lookup Decoding, modelos rascunho, MTP) para geração até 2x mais rápida
- Geração de imagens (Krea-2-Turbo, FLUX.2) e edição de fotos a partir de instruções de texto
- Geração de vídeo (LTX-Video 2.3) com áudio sincronizado e personagens falantes
- Clonagem de voz e texto-para-fala (Qwen3-TTS) a partir de alguns segundos de áudio
- Modo agente com 10 ferramentas integradas (shell, arquivo, pesquisa, navegação, etc.) e suporte ao servidor MCP
- Sandbox de agente usando Virtualização Apple para execução isolada de comandos
- API compatível com Ollama para substituição direta de aplicativos Ollama
- Integração com Claude Code para agentes de codificação locais
- Quantização de cache KV e agrupamento contínuo para múltiplos chats simultâneos
mlx-serve Casos de uso
- Executar LLMs locais para assistência de IA privada sem internet
- Desenvolver e testar agentes de IA com execução de ferramentas em sandbox
- Substituir APIs em nuvem para agentes de codificação (Claude Code, Cursor, Continue)
- Gerar imagens, vídeo e áudio no dispositivo para projetos criativos
- Criar assistentes de IA personalizados com controle por voz e agendamento
mlx-serve Preços e créditos grátis
mlx-serve funciona no modelo Grátis.
Esta ferramenta é totalmente gratuita
mlx-serve Prós e contras
Prós
- Mais rápido que LM Studio e Ollama em modelos idênticos
- Completamente local e privado – nenhum dado sai do seu Mac
- Suporta uma enorme gama de modelos (MLX, GGUF, DeepSeek V4 Flash)
- Inclui geração e edição de imagem, vídeo e voz
- Leve (~4,5 MB) e fácil de instalar como aplicativo Mac nativo
- Integração perfeita com ferramentas existentes via APIs OpenAI/Anthropic/Ollama
Contras
- Apenas Mac (requer Apple Silicon)
- Alguns recursos avançados (ex.: DeepSeek V4) precisam de muita memória (96 GB+)
- Sem sincronização em nuvem ou suporte a múltiplos dispositivos
Para que mlx-serve é melhor?
- Usuários de Mac que desejam IA local privada e de alto desempenho
- Desenvolvedores criando agentes de IA e assistentes de codificação
- Criadores de conteúdo que precisam de geração offline de imagem/vídeo/áudio
- Indivíduos e organizações preocupados com privacidade