AI 开源模型

mlx-serve

在你的Mac上本地运行任何LLM,比LM Studio或Ollama更快,支持聊天、编码智能体、图像、视频和语音,完全离线且开源。

mlx-serve logo

mlx-serve

访问官网

什么是 mlx-serve?

mlx-serve 是一款免费开源macOS应用,利用Apple的MLX框架在Mac上完全本地运行大型语言模型(LLM),性能优于LM Studio和Ollama等替代方案。它支持多种模型,包括DeepSeek V4 Flash、Gemma 4、Qwen等,并提供推测解码、语音克隆、图像生成和智能体沙箱等功能。

mlx-serve 与相似工具比较

计价模式免费免费免费免费
免费额度
主要功能
  • 在Apple Silicon上通过原生Metal加速进行本地推理
  • 推测解码(提示查找解码、草稿模型、MTP)实现高达2倍的生成速度
  • 图像生成(Krea-2-Turbo、FLUX.2)及根据文本指令编辑照片
  • 本地优先存储,无需托管的向量 SaaS
  • 通过自然语言查询进行语义回忆
  • 支持多代理安全的并发写入
  • 使用Project Panama FFM API实现零分配推理
  • 统一的LLM、ASR、TTS和多模态模型运行时
  • 进程全局后端消除VRAM碎片
  • 本地 AI 模型完全在 Mac 上运行
  • 读取、写入和执行文件
  • 具有语音控制的自主代理
优点
  • 在相同模型上比LM Studio和Ollama更快
  • 完全本地和私密——数据不离开Mac
  • 本地优先,注重隐私
  • 按语义进行搜索
  • Java中零分配设计实现高性能
  • 跨多种模型类型(文本、视觉、音频)的统一API
  • 完全隐私——数据永不离开设备
  • 无需网络即可离线工作
缺点
  • 仅限Mac(需要Apple Silicon)
  • 某些高级功能(如DeepSeek V4)需要高内存(96 GB以上)
  • 需要嵌入 API 服务(兼容 OpenAI)
  • 仅限于 TypeScript/JavaScript 环境
  • 需要Java 22+和Project Panama(并非所有JVM都默认支持)
  • 由于原生编译,构建过程对新手可能较复杂
  • 需要 Apple Silicon(M1 或更新)
  • 仅支持 macOS 15.5+
适合对象
  • 需要私有高性能本地AI的Mac用户
  • 构建AI智能体和编码助手的开发者
  • 构建多代理 AI 系统的开发者
  • 需要持久化共享代理记忆的团队
  • 构建低内存开销AI应用的Java开发者
  • 需要本地化、高吞吐量LLM和多模态模型推理的项目
  • 注重隐私的用户
  • 处理敏感代码的开发者

如何使用 mlx-serve?

  1. 1从GitHub Releases下载MLX Core应用,或通过Homebrew安装。
  2. 2启动应用,使用模型浏览器下载任何支持的模型。
  3. 3在内置界面中开始聊天,或通过兼容OpenAI/Anthropic的API连接外部应用。
  4. 4使用⌃Space启动器快速访问,或配置语音和Telegram机器人进行远程控制。

mlx-serve 主要功能

  • 在Apple Silicon上通过原生Metal加速进行本地推理
  • 推测解码(提示查找解码、草稿模型、MTP)实现高达2倍的生成速度
  • 图像生成(Krea-2-Turbo、FLUX.2)及根据文本指令编辑照片
  • 视频生成(LTX-Video 2.3)支持同步音频和说话角色
  • 语音克隆及文本转语音(Qwen3-TTS),仅需几秒音频
  • 智能体模式内置10种工具(Shell、文件、搜索、浏览等)并支持MCP服务器
  • 使用Apple虚拟化实现智能体沙箱,隔离命令执行
  • 兼容Ollama API,可作为Ollama应用的即插即用替代
  • 集成Claude Code用于本地编码智能体
  • KV缓存量化及连续批处理支持多并发聊天

mlx-serve 使用场景

  • 无互联网环境下运行本地LLM进行私有AI辅助
  • 开发并测试具有沙箱工具执行的AI智能体
  • 替代云API用于编码智能体(Claude Code、Cursor、Continue)
  • 在设备上生成图像、视频和音频进行创意项目
  • 构建带语音控制和调度的自定义AI助手

mlx-serve 价格与免费额度

mlx-serve 目前采用 免费 模式。

此工具完全免费使用

免费(开源)

$0

功能完整的MIT许可证应用,无使用限制或订阅。

mlx-serve 优缺点

优点

  • 在相同模型上比LM Studio和Ollama更快
  • 完全本地和私密——数据不离开Mac
  • 支持大量模型(MLX、GGUF、DeepSeek V4 Flash)
  • 包含图像、视频、语音生成和编辑
  • 轻量级(约4.5 MB)易于安装为原生Mac应用
  • 通过OpenAI/Anthropic/Ollama API与现有工具无缝集成

缺点

  • 仅限Mac(需要Apple Silicon)
  • 某些高级功能(如DeepSeek V4)需要高内存(96 GB以上)
  • 无内置云同步或多设备支持

mlx-serve 最适合哪些用途?

  • 需要私有高性能本地AI的Mac用户
  • 构建AI智能体和编码助手的开发者
  • 需要离线图像/视频/音频生成的内容创作者
  • 注重隐私的个人和组织

mlx-serve 常见问题

mlx-serve 的免费替代工具

Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
PixaryAI logo

PixaryAI 是一款在线 AI 视频生成器,可通过基于浏览器的控制,从文本提示或图片创建视频。

免费

mlx-serve 的最佳替代 AI 工具

Wolbarg logo

Wolbarg 是一个本地优先的 TypeScript SDK,为 AI 代理提供使用 SQLite 或 PostgreSQL 的共享语义记忆。

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

Osaurus logo

Osaurus 是一款专为 Mac 设计的私密本地 AI 助手,可在设备上运行开源模型,并可选云 AI 访问和自主代理。

Reame logo

一个精简、经过充分测试的 LLM 推理服务器,专为廉价 CPU 硬件设计,具有持久缓存和 OpenAI 兼容的 API。

colibri logo

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

Frugon logo

Frugon 是一个免费、开源的 LLM 成本分析工具,通过本地分析您的调用日志,识别出您的 LLM 账单在哪里产生不必要的花费。

Branchless NCCL Router logo

一款面向32-GPU分布式网格网络的无分支、零抖动入站路由器,利用JAX/XLA和NCCL。

Skeights logo

Skeights 将训练好的 scikit-learn 模型序列化为 safetensors 和 JSON 格式,用安全、可检查的格式替代不安全的 pickle。