Modelos de Código Abierto IA

mlx-serve

Ejecuta cualquier LLM localmente en tu Mac más rápido que LM Studio u Ollama, con chat, agentes de codificación, imágenes, video y voz, todo completamente offline y de código abierto.

mlx-serve logo

mlx-serve

Visitar sitio

Qué es mlx-serve?

mlx-serve es una aplicación gratuita y de código abierto para macOS que ejecuta modelos de lenguaje grandes (LLM) completamente en tu Mac utilizando el framework MLX de Apple, proporcionando inferencia más rápida que alternativas como LM Studio y Ollama. Admite una amplia gama de modelos, incluyendo DeepSeek V4 Flash, Gemma 4, Qwen y más, y ofrece funciones como decodificación especulativa, clonación de voz, generación de imágenes y sandbox de agentes.

mlx-serve vs Herramientas Similares

Modelo de PreciosGratisGratisGratisGratis
Créditos Gratis
Funciones principales
  • Inferencia local en Apple Silicon con aceleración nativa Metal
  • Decodificación especulativa (Prompt Lookup Decoding, modelos draft, MTP) para generación hasta 2x más rápida
  • Generación de imágenes (Krea-2-Turbo, FLUX.2) y edición de fotos desde instrucciones de texto
  • Almacenamiento local-first sin necesidad de SaaS de vectores alojado
  • Recuperación semántica mediante consultas en lenguaje natural
  • Escrituras concurrentes seguras para múltiples agentes
  • Inferencia sin asignación de memoria con API FFM de Project Panama
  • Runtime unificado para modelos LLM, ASR, TTS y multimodales
  • Backend a nivel de proceso para eliminar la fragmentación de VRAM
  • Modelos de IA locales ejecutados completamente en el Mac
  • Lee, escribe y ejecuta acciones en archivos
  • Agentes autónomos con control por voz
Ventajas
  • Más rápido que LM Studio y Ollama en modelos idénticos
  • Completamente local y privado – ningún dato sale de tu Mac
  • Local-first y centrado en la privacidad
  • Búsqueda semántica por significado
  • Diseño sin asignación de memoria para alto rendimiento en Java
  • API unificada para múltiples tipos de modelos (texto, visión, audio)
  • Privacidad total: los datos nunca salen del dispositivo
  • Funciona sin conexión a internet
Desventajas
  • Solo para Mac (requiere Apple Silicon)
  • Algunas funciones avanzadas (ej. DeepSeek V4) requieren mucha memoria (96 GB+)
  • Requiere un servicio de API de incrustaciones (compatible con OpenAI)
  • Limitado a entornos TypeScript/JavaScript
  • Requiere Java 22+ y Project Panama (aún no estándar en todas las JVM)
  • El proceso de compilación puede ser complejo para principiantes debido a la compilación nativa
  • Requiere Apple Silicon (M1 o posterior)
  • Solo compatible con macOS 15.5+
Ideal para
  • Usuarios de Mac que quieren IA local privada y de alto rendimiento
  • Desarrolladores que construyen agentes de IA y asistentes de codificación
  • Desarrolladores que construyen sistemas de IA multiagente
  • Equipos que necesitan memoria de agente persistente y compartida
  • Desarrolladores Java que crean aplicaciones de IA con bajo consumo de memoria
  • Proyectos que necesitan inferencia local de alto rendimiento para LLMs y modelos multimodales
  • Usuarios conscientes de la privacidad
  • Desarrolladores que trabajan con código sensible

Cómo usar mlx-serve?

  1. 1Descarga la aplicación MLX Core desde GitHub Releases o instálala via Homebrew.
  2. 2Inicia la aplicación y usa el Navegador de Modelos para descargar cualquier modelo compatible.
  3. 3Empieza a chatear en la interfaz integrada o conecta aplicaciones externas a través de la API compatible con OpenAI/Anthropic.
  4. 4Usa el lanzador ⌃Space para acceso rápido, o configura voz y bot de Telegram para control remoto.

mlx-serve Funciones principales

  • Inferencia local en Apple Silicon con aceleración nativa Metal
  • Decodificación especulativa (Prompt Lookup Decoding, modelos draft, MTP) para generación hasta 2x más rápida
  • Generación de imágenes (Krea-2-Turbo, FLUX.2) y edición de fotos desde instrucciones de texto
  • Generación de video (LTX-Video 2.3) con audio sincronizado y personajes parlantes
  • Clonación de voz y texto a voz (Qwen3-TTS) desde unos segundos de audio
  • Modo agente con 10 herramientas integradas (shell, archivo, búsqueda, navegación, etc.) y soporte para servidor MCP
  • Sandbox de agente usando Virtualización de Apple para ejecución aislada de comandos
  • API compatible con Ollama para reemplazo directo de aplicaciones Ollama
  • Integración con Claude Code para agentes de codificación locales
  • Cuantización de caché KV y batching continuo para múltiples chats concurrentes

mlx-serve Casos de uso

  • Ejecutar LLMs locales para asistencia de IA privada sin internet
  • Desarrollar y probar agentes de IA con ejecución de herramientas en sandbox
  • Reemplazar APIs en la nube para agentes de codificación (Claude Code, Cursor, Continue)
  • Generar imágenes, video y audio en el dispositivo para proyectos creativos
  • Construir asistentes de IA personalizados con control por voz y programación

mlx-serve Precios y créditos gratis

mlx-serve funciona con un modelo Gratis.

Esta herramienta es completamente gratuita

Gratis (Código Abierto)

$0

Aplicación con licencia MIT con todas las funciones, sin límites de uso ni suscripciones.

mlx-serve Ventajas y desventajas

Ventajas

  • Más rápido que LM Studio y Ollama en modelos idénticos
  • Completamente local y privado – ningún dato sale de tu Mac
  • Admite una gran variedad de modelos (MLX, GGUF, DeepSeek V4 Flash)
  • Incluye generación y edición de imágenes, video y voz
  • Ligero (~4.5 MB) y fácil de instalar como aplicación nativa de Mac
  • Integración perfecta con herramientas existentes a través de APIs de OpenAI/Anthropic/Ollama

Desventajas

  • Solo para Mac (requiere Apple Silicon)
  • Algunas funciones avanzadas (ej. DeepSeek V4) requieren mucha memoria (96 GB+)
  • Sin sincronización en la nube integrada ni soporte multi-dispositivo

¿Para qué es mejor mlx-serve?

  • Usuarios de Mac que quieren IA local privada y de alto rendimiento
  • Desarrolladores que construyen agentes de IA y asistentes de codificación
  • Creadores de contenido que necesitan generación offline de imágenes/video/audio
  • Individuos y organizaciones preocupados por la privacidad

Preguntas frecuentes sobre mlx-serve

Alternativas gratis a mlx-serve

Oxlo.ai logo

Oxlo.ai es una API de inferencia de IA centrada en la privacidad que ofrece precios por solicitud para más de 45 modelos de código abierto.

Gratis
PixaryAI logo

PixaryAI es un generador de video con IA en línea para crear videos a partir de prompts de texto o imágenes, con controles basados en el navegador.

Gratis

Mejores alternativas de herramientas IA a mlx-serve

Wolbarg logo

Wolbarg es un SDK TypeScript local-first que proporciona memoria semántica compartida para agentes de IA usando SQLite o PostgreSQL.

Osaurus logo

Osaurus es un asistente de IA local y privado para Mac que ejecuta modelos abiertos en el dispositivo, con acceso opcional a IA en la nube y agentes autónomos.

Reame logo

Un servidor de inferencia LLM ligero y completamente probado, construido para hardware de CPU económico, con almacenamiento en caché persistente y una API compatible con OpenAI.

colibri logo

Un motor en C sin dependencias que transmite pesos de expertos desde el disco para ejecutar el modelo GLM-5.2 MoE de 744B parámetros en hardware de consumo con tan solo 25 GB de RAM.

Frugon logo

Frugon es un analizador de costos de LLM gratuito y de código abierto que identifica dónde se filtran los costos de tu factura de LLM analizando tus registros de llamadas localmente.

Branchless NCCL Router logo

Un enrutador de ingreso sin bifurcaciones y sin jitter para redes de malla distribuidas de 32 GPU utilizando JAX/XLA y NCCL.

Skeights logo

Skeights serializa modelos ajustados de scikit-learn a safetensors y JSON, reemplazando el inseguro pickle con un formato seguro e inspeccionable.