AI 大语言模型 (LLM)

colibri

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

什么是 colibri?

colibri是一个轻量级、纯C语言实现的推理引擎,专为GLM-5.2 744B参数混合专家模型设计。它从磁盘流式传输专家权重,运行时无需Python、GPU或外部依赖,可在约25 GB RAM的机器上本地运行。

colibri 与相似工具比较

计价模式免费免费免费免费, Freemium
免费额度
主要功能
  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
  • 原生加载DeepSeek V4、Qwen3.6和GLM 5.2模型
  • 自适应Metal驻留和SSD流式处理,适用于内存受限系统
  • 支持工具调用和编码代理的HTTP服务器
  • 使用Project Panama FFM API实现零分配推理
  • 统一的LLM、ASR、TTS和多模态模型运行时
  • 进程全局后端消除VRAM碎片
  • 通过一个API统一访问300多个AI模型
  • 兼容OpenAI SDK的端点
  • 欧盟托管且符合GDPR的基础设施
优点
  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
  • 完全本地运行,确保数据隐私
  • 针对Apple Silicon优化,支持Metal加速
  • Java中零分配设计实现高性能
  • 跨多种模型类型(文本、视觉、音频)的统一API
  • 通过单个API访问300多个模型
  • 欧盟托管且符合GDPR,非常适合欧洲公司
缺点
  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
  • 主要为Apple Silicon设计;CUDA/ROCm后端为次要
  • 不是通用的GGUF运行器,仅支持特定模型
  • 需要Java 22+和Project Panama(并非所有JVM都默认支持)
  • 由于原生编译,构建过程对新手可能较复杂
  • 没有账户时定价不完全透明
  • 购买积分3%的手续费可能是隐藏成本
适合对象
  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员
  • 希望进行设备端LLM推理的Apple Silicon Mac用户
  • 寻求专用高性能推理引擎的开发者
  • 构建低内存开销AI应用的Java开发者
  • 需要本地化、高吞吐量LLM和多模态模型推理的项目
  • 需要多模型访问并符合欧盟合规的开发者
  • 构建AI智能体和应用的团队

如何使用 colibri?

  1. 1克隆仓库:git clone https://github.com/JustVugg/colibri.git
  2. 2构建引擎:cd c && make
  3. 3将FP8模型转换为int4:./coli convert --model /path/to/model
  4. 4运行聊天:COLI_MODEL=/path/to/model ./coli chat
  5. 5(可选)使用Web UI或兼容OpenAI的服务器获取图形界面。

colibri 主要功能

  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
  • MLA注意力机制,压缩KV缓存(缩小57倍)
  • 原生MTP投机解码,每次前向最多2.8个令牌
  • 整数点积内核(int8/int4),支持AVX2加速
  • 适应使用模式的在线学习缓存

colibri 使用场景

  • 在消费级笔记本电脑或台式机上运行744B参数MoE模型
  • 无需云依赖的离线聊天和推理
  • 大型MoE架构的研究与实验
  • 在有限硬件上进行前沿模型能力的教育演示

colibri 价格与免费额度

colibri 目前采用 免费 模式。

此工具完全免费使用

开源

免费

Apache 2.0许可证。使用或修改无需成本。

colibri 优缺点

优点

  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
  • 带缓存的高效磁盘流式传输支持长时间使用
  • 活跃的社区基准测试和改进

缺点

  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
  • 仅支持GLM-5.2模型(无多模型灵活性)
  • CUDA后端尚在实验阶段且功能有限

colibri 最适合哪些用途?

  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员
  • 对无需云成本进行前沿模型推理感兴趣的爱好者

colibri 常见问题

colibri 的免费替代工具

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
discode.ai logo

一个聊天气泡界面,即可访问超过100个AI模型,自动为您的任务选择最佳模型,同时跟踪能源使用并保护您的隐私。

免费
Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
Graphsignal logo

Graphsignal 是一个生产级推理性能分析平台,帮助工程师跨模型、引擎、GPU 及其他加速器优化 AI 性能。

免费

colibri 的最佳替代 AI 工具

DwarfStar logo

一个专门用于大型语言模型的本地推理引擎,针对Apple Silicon和内存受限系统上的SSD流式处理进行了优化。

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
Auriko logo

用于LLM推理的统一API平台,具有成本优化、路由、可观测性和自动故障转移功能。

L

一款基于浏览器的工具,利用雅可比透镜实时读取语言模型的内部概念。

Frugon logo

Frugon 是一个免费、开源的 LLM 成本分析工具,通过本地分析您的调用日志,识别出您的 LLM 账单在哪里产生不必要的花费。