Modelos de Código Aberto IA

mlx-serve

Execute qualquer LLM localmente no seu Mac mais rápido que o LM Studio ou Ollama, com chat, agentes de codificação, imagens, vídeo e voz, tudo totalmente offline e de código aberto.

mlx-serve logo

mlx-serve

Visitar site

O que é mlx-serve?

O mlx-serve é um aplicativo gratuito e de código aberto para macOS que executa modelos de linguagem grandes (LLMs) inteiramente no seu Mac usando o framework MLX da Apple, oferecendo inferência mais rápida que alternativas como LM Studio e Ollama. Suporta uma vasta gama de modelos, incluindo DeepSeek V4 Flash, Gemma 4, Qwen e outros, e oferece funcionalidades como decodificação especulativa, clonagem de voz, geração de imagens e sandbox de agentes.

mlx-serve vs Ferramentas Similares

Modelo de PreçosGrátisGrátisGrátisGrátis
Créditos Grátis
Principais recursos
  • Inferência local no Apple Silicon com aceleração nativa Metal
  • Decodificação especulativa (Prompt Lookup Decoding, modelos rascunho, MTP) para geração até 2x mais rápida
  • Geração de imagens (Krea-2-Turbo, FLUX.2) e edição de fotos a partir de instruções de texto
  • Armazenamento local-first sem necessidade de SaaS de vetores hospedado
  • Recuperação semântica via consultas em linguagem natural
  • Escritas concorrentes seguras para múltiplos agentes
  • Inferência com zero alocação usando API FFM do Project Panama
  • Runtime unificado para modelos LLM, ASR, TTS e multimodais
  • Backend global de processo para eliminar fragmentação de VRAM
  • Modelos de IA locais executados inteiramente no Mac
  • Lê, escreve e executa em arquivos
  • Agentes autônomos com controle de voz
Prós
  • Mais rápido que LM Studio e Ollama em modelos idênticos
  • Completamente local e privado – nenhum dado sai do seu Mac
  • Local-first e focado em privacidade
  • Pesquisa semântica por significado
  • Design com zero alocação para alto desempenho em Java
  • API unificada em vários tipos de modelo (texto, visão, áudio)
  • Privacidade total – os dados nunca saem do dispositivo
  • Funciona offline sem internet
Contras
  • Apenas Mac (requer Apple Silicon)
  • Alguns recursos avançados (ex.: DeepSeek V4) precisam de muita memória (96 GB+)
  • Requer um serviço de API de incorporação (compatível com OpenAI)
  • Limitado a ambientes TypeScript/JavaScript
  • Requer Java 22+ e Project Panama (ainda não padrão em todas as JVMs)
  • Processo de compilação pode ser complexo para iniciantes devido à compilação nativa
  • Requer Apple Silicon (M1 ou posterior)
  • Suporta apenas macOS 15.5+
Melhor para
  • Usuários de Mac que desejam IA local privada e de alto desempenho
  • Desenvolvedores criando agentes de IA e assistentes de codificação
  • Desenvolvedores construindo sistemas multiagente de IA
  • Equipes que precisam de memória persistente e compartilhada para agentes
  • Desenvolvedores Java criando aplicações de IA com baixo consumo de memória
  • Projetos que precisam de inferência local de alto throughput para LLMs e modelos multimodais
  • Usuários preocupados com privacidade
  • Desenvolvedores que trabalham com código sensível

Como usar mlx-serve?

  1. 1Baixe o aplicativo MLX Core a partir dos GitHub Releases ou instale via Homebrew.
  2. 2Inicie o aplicativo e use o Navegador de Modelos para baixar qualquer modelo suportado.
  3. 3Comece a conversar na interface integrada ou conecte aplicativos externos através da API compatível com OpenAI/Anthropic.
  4. 4Use o lançador ⌃Space para acesso rápido, ou configure o bot de voz e Telegram para controle remoto.

mlx-serve Principais recursos

  • Inferência local no Apple Silicon com aceleração nativa Metal
  • Decodificação especulativa (Prompt Lookup Decoding, modelos rascunho, MTP) para geração até 2x mais rápida
  • Geração de imagens (Krea-2-Turbo, FLUX.2) e edição de fotos a partir de instruções de texto
  • Geração de vídeo (LTX-Video 2.3) com áudio sincronizado e personagens falantes
  • Clonagem de voz e texto-para-fala (Qwen3-TTS) a partir de alguns segundos de áudio
  • Modo agente com 10 ferramentas integradas (shell, arquivo, pesquisa, navegação, etc.) e suporte ao servidor MCP
  • Sandbox de agente usando Virtualização Apple para execução isolada de comandos
  • API compatível com Ollama para substituição direta de aplicativos Ollama
  • Integração com Claude Code para agentes de codificação locais
  • Quantização de cache KV e agrupamento contínuo para múltiplos chats simultâneos

mlx-serve Casos de uso

  • Executar LLMs locais para assistência de IA privada sem internet
  • Desenvolver e testar agentes de IA com execução de ferramentas em sandbox
  • Substituir APIs em nuvem para agentes de codificação (Claude Code, Cursor, Continue)
  • Gerar imagens, vídeo e áudio no dispositivo para projetos criativos
  • Criar assistentes de IA personalizados com controle por voz e agendamento

mlx-serve Preços e créditos grátis

mlx-serve funciona no modelo Grátis.

Esta ferramenta é totalmente gratuita

Grátis (Código Aberto)

$0

Aplicativo com licença MIT completo, sem limites de uso ou assinaturas.

mlx-serve Prós e contras

Prós

  • Mais rápido que LM Studio e Ollama em modelos idênticos
  • Completamente local e privado – nenhum dado sai do seu Mac
  • Suporta uma enorme gama de modelos (MLX, GGUF, DeepSeek V4 Flash)
  • Inclui geração e edição de imagem, vídeo e voz
  • Leve (~4,5 MB) e fácil de instalar como aplicativo Mac nativo
  • Integração perfeita com ferramentas existentes via APIs OpenAI/Anthropic/Ollama

Contras

  • Apenas Mac (requer Apple Silicon)
  • Alguns recursos avançados (ex.: DeepSeek V4) precisam de muita memória (96 GB+)
  • Sem sincronização em nuvem ou suporte a múltiplos dispositivos

Para que mlx-serve é melhor?

  • Usuários de Mac que desejam IA local privada e de alto desempenho
  • Desenvolvedores criando agentes de IA e assistentes de codificação
  • Criadores de conteúdo que precisam de geração offline de imagem/vídeo/áudio
  • Indivíduos e organizações preocupados com privacidade

Perguntas frequentes sobre mlx-serve

Alternativas gratuitas ao mlx-serve

Oxlo.ai logo

Oxlo.ai é uma API de inferência de IA focada em privacidade que oferece preços por requisição para mais de 45 modelos de código aberto.

Grátis
PixaryAI logo

PixaryAI é um gerador de vídeo com IA online para criar vídeos a partir de prompts de texto ou imagens, com controlos baseados no browser.

Grátis

Melhores alternativas de ferramentas IA ao mlx-serve

Wolbarg logo

Wolbarg é um SDK TypeScript local-first que fornece memória semântica compartilhada para agentes de IA usando SQLite ou PostgreSQL.

Osaurus logo

O Osaurus é um assistente de IA privado e local para Mac que executa modelos abertos no dispositivo, com acesso opcional a IA na nuvem e agentes autônomos.

Reame logo

Um servidor de inferência LLM enxuto e totalmente testado, construído para hardware de CPU barato, com cache persistente e uma API compatível com OpenAI.

colibri logo

Um motor C sem dependências que transmite pesos de especialistas do disco para executar o modelo MoE GLM-5.2 de 744B parâmetros em hardware consumidor com apenas 25 GB de RAM.

Frugon logo

O Frugon é um analisador de custos de LLM gratuito e de código aberto que identifica onde sua fatura de LLM vaza, analisando seus logs de chamadas localmente.

Branchless NCCL Router logo

Um roteador de entrada sem ramificações e com zero jitter para redes mesh distribuídas de 32 GPUs utilizando JAX/XLA e NCCL.

Skeights logo

Skeights serializa modelos scikit-learn ajustados para safetensors e JSON, substituindo o inseguro pickle por um formato seguro e inspecionável.