AI 大语言模型 (LLM)

DwarfStar

一个专门用于大型语言模型的本地推理引擎,针对Apple Silicon和内存受限系统上的SSD流式处理进行了优化。

DwarfStar logo

DwarfStar

访问官网

什么是 DwarfStar?

DwarfStar是一个小巧、自包含的推理引擎,用于本地运行大型语言模型,原生支持DeepSeek、Qwen和GLM模型,具有自适应SSD流式处理和Metal加速功能。

DwarfStar 与相似工具比较

计价模式免费免费免费免费, Freemium
免费额度
主要功能
  • 原生加载DeepSeek V4、Qwen3.6和GLM 5.2模型
  • 自适应Metal驻留和SSD流式处理,适用于内存受限系统
  • 支持工具调用和编码代理的HTTP服务器
  • 使用Project Panama FFM API实现零分配推理
  • 统一的LLM、ASR、TTS和多模态模型运行时
  • 进程全局后端消除VRAM碎片
  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
  • 通过一个API统一访问300多个AI模型
  • 兼容OpenAI SDK的端点
  • 欧盟托管且符合GDPR的基础设施
优点
  • 完全本地运行,确保数据隐私
  • 针对Apple Silicon优化,支持Metal加速
  • Java中零分配设计实现高性能
  • 跨多种模型类型(文本、视觉、音频)的统一API
  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
  • 通过单个API访问300多个模型
  • 欧盟托管且符合GDPR,非常适合欧洲公司
缺点
  • 主要为Apple Silicon设计;CUDA/ROCm后端为次要
  • 不是通用的GGUF运行器,仅支持特定模型
  • 需要Java 22+和Project Panama(并非所有JVM都默认支持)
  • 由于原生编译,构建过程对新手可能较复杂
  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
  • 没有账户时定价不完全透明
  • 购买积分3%的手续费可能是隐藏成本
适合对象
  • 希望进行设备端LLM推理的Apple Silicon Mac用户
  • 寻求专用高性能推理引擎的开发者
  • 构建低内存开销AI应用的Java开发者
  • 需要本地化、高吞吐量LLM和多模态模型推理的项目
  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员
  • 需要多模型访问并符合欧盟合规的开发者
  • 构建AI智能体和应用的团队

如何使用 DwarfStar?

  1. 1安装前提条件:macOS上的Xcode命令行工具。
  2. 2克隆仓库:git clone https://github.com/andreaborio/ds4.git && cd ds4
  3. 3下载模型:./download_model.sh q2-imatrix
  4. 4构建:make
  5. 5运行推理:./ds4 -m ./ds4flash.gguf --nothink
  6. 6启动服务器:./ds4-server -m ./ds4flash.gguf --ctx 32768

DwarfStar 主要功能

  • 原生加载DeepSeek V4、Qwen3.6和GLM 5.2模型
  • 自适应Metal驻留和SSD流式处理,适用于内存受限系统
  • 支持工具调用和编码代理的HTTP服务器
  • RAM和磁盘上的KV状态管理
  • 用于量化和校准的GGUF工具
  • 混合精度路由专家支持
  • 正确性和速度基准测试

DwarfStar 使用场景

  • 在Apple Silicon Mac上本地运行大型语言模型
  • 无需云依赖的隐私保护推理
  • LLM应用的开发和测试
  • 模型量化和流式处理研究

DwarfStar 价格与免费额度

DwarfStar 目前采用 免费 模式。

此工具完全免费使用

开源

免费

MIT许可证,GitHub上自由获取。

DwarfStar 优缺点

优点

  • 完全本地运行,确保数据隐私
  • 针对Apple Silicon优化,支持Metal加速
  • 支持多种大型模型(DeepSeek、Qwen、GLM)
  • 自适应SSD流式处理可运行超出RAM的模型
  • 开源,活跃开发和基准测试

缺点

  • 主要为Apple Silicon设计;CUDA/ROCm后端为次要
  • 不是通用的GGUF运行器,仅支持特定模型
  • 测试版软件,包含一些实验性功能
  • 需要专业技术知识进行设置和配置

DwarfStar 最适合哪些用途?

  • 希望进行设备端LLM推理的Apple Silicon Mac用户
  • 寻求专用高性能推理引擎的开发者
  • 进行模型量化和流式处理实验的研究人员

DwarfStar 常见问题

DwarfStar 的免费替代工具

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
discode.ai logo

一个聊天气泡界面,即可访问超过100个AI模型,自动为您的任务选择最佳模型,同时跟踪能源使用并保护您的隐私。

免费
Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
Graphsignal logo

Graphsignal 是一个生产级推理性能分析平台,帮助工程师跨模型、引擎、GPU 及其他加速器优化 AI 性能。

免费

DwarfStar 的最佳替代 AI 工具

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

colibri logo

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
Auriko logo

用于LLM推理的统一API平台,具有成本优化、路由、可观测性和自动故障转移功能。

L

一款基于浏览器的工具,利用雅可比透镜实时读取语言模型的内部概念。

Frugon logo

Frugon 是一个免费、开源的 LLM 成本分析工具,通过本地分析您的调用日志,识别出您的 LLM 账单在哪里产生不必要的花费。