AI 大语言模型 (LLM)

colibri

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

什么是 colibri?

colibri是一个轻量级、纯C语言实现的推理引擎,专为GLM-5.2 744B参数混合专家模型设计。它从磁盘流式传输专家权重,运行时无需Python、GPU或外部依赖,可在约25 GB RAM的机器上本地运行。

colibri 与相似工具比较

计价模式免费免费, Freemium付费付费
免费额度
主要功能
  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
  • 访问多种AI模型(GPT、Claude、Gemini、DeepSeek、Grok等)
  • 私有工作区团队协作
  • 文件上传支持(PDF、代码、文档)并具有上下文理解
  • 单一模型处理所有任务,无需切换模式
  • 兼容 OpenAI 的 API
  • 在评估任务上达到 Claude Fable 级别的质量
  • 无限 tokens
  • 无限上下文窗口
  • 固定月费定价
优点
  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
  • 一个平台访问多种领先AI模型
  • 内置团队协作功能
  • 高质量,媲美 Claude Fable
  • 比前沿模型显著降低成本
  • 无限 tokens 和上下文
  • 可预测的固定定价
缺点
  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
  • 免费计划消息和积分有限
  • 高级功能需付费订阅
  • 较新模型,独立验证有限
  • 确切定价未公开详细说明
  • 月费高昂(10,000美元以上)
  • 需要 14 天预置时间
适合对象
  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员
  • 需要多样化AI模型访问的团队
  • 内容创作者和研究人员
  • 寻求低成本高质量 LLM 的开发者
  • 需要单一通用模型的团队
  • 大规模运行 AI 代理的企业团队
  • 需要长期代码生成的软件工程团队

如何使用 colibri?

  1. 1克隆仓库:git clone https://github.com/JustVugg/colibri.git
  2. 2构建引擎:cd c && make
  3. 3将FP8模型转换为int4:./coli convert --model /path/to/model
  4. 4运行聊天:COLI_MODEL=/path/to/model ./coli chat
  5. 5(可选)使用Web UI或兼容OpenAI的服务器获取图形界面。

colibri 主要功能

  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
  • MLA注意力机制,压缩KV缓存(缩小57倍)
  • 原生MTP投机解码,每次前向最多2.8个令牌
  • 整数点积内核(int8/int4),支持AVX2加速
  • 适应使用模式的在线学习缓存

colibri 使用场景

  • 在消费级笔记本电脑或台式机上运行744B参数MoE模型
  • 无需云依赖的离线聊天和推理
  • 大型MoE架构的研究与实验
  • 在有限硬件上进行前沿模型能力的教育演示

colibri 价格与免费额度

colibri 目前采用 免费 模式。

此工具完全免费使用

开源

免费

Apache 2.0许可证。使用或修改无需成本。

colibri 优缺点

优点

  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
  • 带缓存的高效磁盘流式传输支持长时间使用
  • 活跃的社区基准测试和改进

缺点

  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
  • 仅支持GLM-5.2模型(无多模型灵活性)
  • CUDA后端尚在实验阶段且功能有限

colibri 最适合哪些用途?

  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员
  • 对无需云成本进行前沿模型推理感兴趣的爱好者

colibri 常见问题

colibri 的免费替代工具

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
discode.ai logo

一个聊天气泡界面,即可访问超过100个AI模型,自动为您的任务选择最佳模型,同时跟踪能源使用并保护您的隐私。

免费
Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
Graphsignal logo

Graphsignal 是一个生产级推理性能分析平台,帮助工程师跨模型、引擎、GPU 及其他加速器优化 AI 性能。

免费

colibri 的最佳替代 AI 工具

Aymo AI logo

面向团队的全能AI平台,提供安全协作工作区,可访问GPT、Claude、Gemini等领先AI模型。

EB

Echo 是一款开放权重的 AI 模型,以仅为 Claude 三分之一的价格提供同等级性能,可适应聊天、代码和智能体任务。

L

LiquidBrain.ai 提供固定月费下的无限 tokens 和上下文 AI 推理,采用专利分布式推理引擎,实现私有、可扩展的模型部署。

DwarfStar logo

一个专门用于大型语言模型的本地推理引擎,针对Apple Silicon和内存受限系统上的SSD流式处理进行了优化。

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
Auriko logo

用于LLM推理的统一API平台,具有成本优化、路由、可观测性和自动故障转移功能。