AI 开源模型
mlx-serve
在你的Mac上本地运行任何LLM,比LM Studio或Ollama更快,支持聊天、编码智能体、图像、视频和语音,完全离线且开源。
mlx-serve
什么是 mlx-serve?
mlx-serve 是一款免费开源macOS应用,利用Apple的MLX框架在Mac上完全本地运行大型语言模型(LLM),性能优于LM Studio和Ollama等替代方案。它支持多种模型,包括DeepSeek V4 Flash、Gemma 4、Qwen等,并提供推测解码、语音克隆、图像生成和智能体沙箱等功能。
mlx-serve 与相似工具比较
| 计价模式 | 免费 | 免费 | 免费 | 免费 |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 mlx-serve?
- 1从GitHub Releases下载MLX Core应用,或通过Homebrew安装。
- 2启动应用,使用模型浏览器下载任何支持的模型。
- 3在内置界面中开始聊天,或通过兼容OpenAI/Anthropic的API连接外部应用。
- 4使用⌃Space启动器快速访问,或配置语音和Telegram机器人进行远程控制。
mlx-serve 主要功能
- 在Apple Silicon上通过原生Metal加速进行本地推理
- 推测解码(提示查找解码、草稿模型、MTP)实现高达2倍的生成速度
- 图像生成(Krea-2-Turbo、FLUX.2)及根据文本指令编辑照片
- 视频生成(LTX-Video 2.3)支持同步音频和说话角色
- 语音克隆及文本转语音(Qwen3-TTS),仅需几秒音频
- 智能体模式内置10种工具(Shell、文件、搜索、浏览等)并支持MCP服务器
- 使用Apple虚拟化实现智能体沙箱,隔离命令执行
- 兼容Ollama API,可作为Ollama应用的即插即用替代
- 集成Claude Code用于本地编码智能体
- KV缓存量化及连续批处理支持多并发聊天
mlx-serve 使用场景
- 无互联网环境下运行本地LLM进行私有AI辅助
- 开发并测试具有沙箱工具执行的AI智能体
- 替代云API用于编码智能体(Claude Code、Cursor、Continue)
- 在设备上生成图像、视频和音频进行创意项目
- 构建带语音控制和调度的自定义AI助手
mlx-serve 价格与免费额度
mlx-serve 目前采用 免费 模式。
此工具完全免费使用
mlx-serve 优缺点
优点
- 在相同模型上比LM Studio和Ollama更快
- 完全本地和私密——数据不离开Mac
- 支持大量模型(MLX、GGUF、DeepSeek V4 Flash)
- 包含图像、视频、语音生成和编辑
- 轻量级(约4.5 MB)易于安装为原生Mac应用
- 通过OpenAI/Anthropic/Ollama API与现有工具无缝集成
缺点
- 仅限Mac(需要Apple Silicon)
- 某些高级功能(如DeepSeek V4)需要高内存(96 GB以上)
- 无内置云同步或多设备支持
mlx-serve 最适合哪些用途?
- 需要私有高性能本地AI的Mac用户
- 构建AI智能体和编码助手的开发者
- 需要离线图像/视频/音频生成的内容创作者
- 注重隐私的个人和组织