Modelos de Código Abierto IA
mlx-serve
Ejecuta cualquier LLM localmente en tu Mac más rápido que LM Studio u Ollama, con chat, agentes de codificación, imágenes, video y voz, todo completamente offline y de código abierto.
mlx-serve
Qué es mlx-serve?
mlx-serve es una aplicación gratuita y de código abierto para macOS que ejecuta modelos de lenguaje grandes (LLM) completamente en tu Mac utilizando el framework MLX de Apple, proporcionando inferencia más rápida que alternativas como LM Studio y Ollama. Admite una amplia gama de modelos, incluyendo DeepSeek V4 Flash, Gemma 4, Qwen y más, y ofrece funciones como decodificación especulativa, clonación de voz, generación de imágenes y sandbox de agentes.
mlx-serve vs Herramientas Similares
| Modelo de Precios | Gratis | Gratis | Gratis | Gratis |
| Créditos Gratis | ||||
| Funciones principales |
|
|
|
|
| Ventajas |
|
|
|
|
| Desventajas |
|
|
|
|
| Ideal para |
|
|
|
|
Cómo usar mlx-serve?
- 1Descarga la aplicación MLX Core desde GitHub Releases o instálala via Homebrew.
- 2Inicia la aplicación y usa el Navegador de Modelos para descargar cualquier modelo compatible.
- 3Empieza a chatear en la interfaz integrada o conecta aplicaciones externas a través de la API compatible con OpenAI/Anthropic.
- 4Usa el lanzador ⌃Space para acceso rápido, o configura voz y bot de Telegram para control remoto.
mlx-serve Funciones principales
- Inferencia local en Apple Silicon con aceleración nativa Metal
- Decodificación especulativa (Prompt Lookup Decoding, modelos draft, MTP) para generación hasta 2x más rápida
- Generación de imágenes (Krea-2-Turbo, FLUX.2) y edición de fotos desde instrucciones de texto
- Generación de video (LTX-Video 2.3) con audio sincronizado y personajes parlantes
- Clonación de voz y texto a voz (Qwen3-TTS) desde unos segundos de audio
- Modo agente con 10 herramientas integradas (shell, archivo, búsqueda, navegación, etc.) y soporte para servidor MCP
- Sandbox de agente usando Virtualización de Apple para ejecución aislada de comandos
- API compatible con Ollama para reemplazo directo de aplicaciones Ollama
- Integración con Claude Code para agentes de codificación locales
- Cuantización de caché KV y batching continuo para múltiples chats concurrentes
mlx-serve Casos de uso
- Ejecutar LLMs locales para asistencia de IA privada sin internet
- Desarrollar y probar agentes de IA con ejecución de herramientas en sandbox
- Reemplazar APIs en la nube para agentes de codificación (Claude Code, Cursor, Continue)
- Generar imágenes, video y audio en el dispositivo para proyectos creativos
- Construir asistentes de IA personalizados con control por voz y programación
mlx-serve Precios y créditos gratis
mlx-serve funciona con un modelo Gratis.
Esta herramienta es completamente gratuita
mlx-serve Ventajas y desventajas
Ventajas
- Más rápido que LM Studio y Ollama en modelos idénticos
- Completamente local y privado – ningún dato sale de tu Mac
- Admite una gran variedad de modelos (MLX, GGUF, DeepSeek V4 Flash)
- Incluye generación y edición de imágenes, video y voz
- Ligero (~4.5 MB) y fácil de instalar como aplicación nativa de Mac
- Integración perfecta con herramientas existentes a través de APIs de OpenAI/Anthropic/Ollama
Desventajas
- Solo para Mac (requiere Apple Silicon)
- Algunas funciones avanzadas (ej. DeepSeek V4) requieren mucha memoria (96 GB+)
- Sin sincronización en la nube integrada ni soporte multi-dispositivo
¿Para qué es mejor mlx-serve?
- Usuarios de Mac que quieren IA local privada y de alto rendimiento
- Desarrolladores que construyen agentes de IA y asistentes de codificación
- Creadores de contenido que necesitan generación offline de imágenes/video/audio
- Individuos y organizaciones preocupados por la privacidad