ИИ Большие языковые модели

colibri

Движок на чистом C без зависимостей, который транслирует веса экспертов с диска для запуска 744B-параметрической модели GLM-5.2 MoE на потребительском оборудовании всего с 25 ГБ ОЗУ.

Что такое colibri?

colibri — это легковесный движок инференса на чистом C для модели Mixture-of-Experts GLM-5.2 с 744B параметрами. Он транслирует веса экспертов с диска и не требует Python, GPU или внешних зависимостей во время выполнения, что позволяет запускать локально на машине с ~25 ГБ ОЗУ.

colibri — сравнение с аналогами

Модель ценообразованияБесплатноБесплатно, FreemiumПлатноПлатно
Бесплатные кредиты
Ключевые возможности
  • Чистая реализация на C без внешних зависимостей
  • Потоковая передача весов экспертов с диска с LRU-кэшем и опциональным закрепленным горячим хранилищем
  • Точный прямой проход GLM-5.2 (glm_moe_dsa), подтвержденный до токена
  • Доступ к нескольким моделям ИИ (GPT, Claude, Gemini, DeepSeek, Grok и др.)
  • Совместная работа команды в приватных рабочих пространствах
  • Поддержка загрузки файлов (PDF, код, документы) с контекстным пониманием
  • Единая модель для всех задач без переключения режимов
  • API, совместимый с OpenAI
  • Качество уровня Claude Fable на оценённых задачах
  • Неограниченное количество токенов
  • Неограниченный контекст
  • Фиксированная ежемесячная цена
Плюсы
  • Запускает модель с 744B параметров на потребительском оборудовании всего с 25 ГБ ОЗУ
  • Открытый исходный код и полная прозрачность (код на C, без зависимостей)
  • Доступ к нескольким ведущим моделям ИИ на одной платформе
  • Встроенные функции совместной работы в команде
  • Высокое качество, сравнимое с Claude Fable
  • Значительно ниже стоимость по сравнению с передовыми моделями
  • Неограниченное количество токенов и контекста
  • Предсказуемая фиксированная цена
Минусы
  • Очень медленное холодное декодирование (0.05-0.1 ток/с на типичном NVMe)
  • Требуется ~370 ГБ дискового пространства для конвертированной модели int4
  • Ограниченное количество сообщений и кредитов на бесплатном плане
  • Расширенные функции требуют платной подписки
  • Новая модель с ограниченной независимой проверкой
  • Точные цены публично не указаны
  • Высокая ежемесячная стоимость (от $10 000)
  • Требуется 14-дневное выделение оборудования
Кому подходит
  • Разработчикам, желающим запускать большие модели локально
  • Исследователям ИИ, изучающим архитектуры MoE на ограниченном оборудовании
  • Командам, которым нужен доступ к разнообразным AI-моделям
  • Создателям контента и исследователям
  • Разработчики, ищущие высококачественную LLM по низкой цене
  • Команды, нуждающиеся в единой универсальной модели
  • Корпоративные команды, использующие AI-агентов в масштабе
  • Команды разработчиков ПО, требующие длительной генерации кода

Как использовать colibri?

  1. 1Клонируйте репозиторий: git clone https://github.com/JustVugg/colibri.git
  2. 2Соберите движок: cd c && make
  3. 3Конвертируйте модель FP8 в int4: ./coli convert --model /path/to/model
  4. 4Запустите чат: COLI_MODEL=/path/to/model ./coli chat
  5. 5(Опционально) Используйте веб-интерфейс или совместимый с OpenAI сервер для графического интерфейса.

colibri Ключевые возможности

  • Чистая реализация на C без внешних зависимостей
  • Потоковая передача весов экспертов с диска с LRU-кэшем и опциональным закрепленным горячим хранилищем
  • Точный прямой проход GLM-5.2 (glm_moe_dsa), подтвержденный до токена
  • Внимание MLA со сжатым KV-кэшем (в 57 раз меньше)
  • Встроенное спекулятивное декодирование MTP для до 2.8 токенов за прямой проход
  • Ядра целочисленного скалярного произведения (int8/int4) с ускорением AVX2
  • Обучаемый на лету кэш, который адаптируется к шаблонам использования

colibri Сценарии использования

  • Запуск 744B-параметрической модели MoE на потребительском ноутбуке или ПК
  • Офлайн чат и инференс без облачных зависимостей
  • Исследования и эксперименты с большими архитектурами MoE
  • Образовательные демонстрации возможностей передовых моделей на ограниченном оборудовании

colibri Цены и бесплатный доступ

Модель оплаты colibri: Бесплатно.

Открытый исходный код

Бесплатно

Лицензия Apache 2.0. Бесплатно для использования и модификации.

colibri Плюсы и минусы

Плюсы

  • Запускает модель с 744B параметров на потребительском оборудовании всего с 25 ГБ ОЗУ
  • Открытый исходный код и полная прозрачность (код на C, без зависимостей)
  • Эффективная потоковая передача с диска с кэшированием позволяет длительное использование
  • Активные бенчмарки и улучшения сообщества

Минусы

  • Очень медленное холодное декодирование (0.05-0.1 ток/с на типичном NVMe)
  • Требуется ~370 ГБ дискового пространства для конвертированной модели int4
  • Поддерживает только модель GLM-5.2 (нет гибкости нескольких моделей)
  • Бэкенд CUDA экспериментальный и ограниченный

Для чего лучше всего подходит colibri?

  • Разработчикам, желающим запускать большие модели локально
  • Исследователям ИИ, изучающим архитектуры MoE на ограниченном оборудовании
  • Энтузиастам, интересующимся инференсом передовых моделей без облачных затрат

Частые вопросы о colibri

Бесплатные альтернативы colibri

Opper AI logo

Единый AI-шлюз, предоставляющий доступ к 300+ ведущим моделям через один API, размещенный в ЕС и соответствующий GDPR, с интерфейсом, совместимым с OpenAI SDK.

Бесплатно
discode.ai logo

Один чат-интерфейс, дающий доступ к более чем 100 моделям ИИ, автоматически выбирающий лучшую модель для вашей задачи, отслеживая энергопотребление и защищая вашу конфиденциальность.

Бесплатно
Oxlo.ai logo

Oxlo.ai — это API для AI-инференса с приоритетом конфиденциальности, предлагающий ценообразование на основе запросов для более чем 45 моделей с открытым исходным кодом.

Бесплатно
Graphsignal logo

Graphsignal — это платформа профилирования вывода производственного масштаба, которая помогает инженерам оптимизировать производительность ИИ в моделях, движках, GPU и других ускорителях.

Бесплатно

Лучшие альтернативы AI инструментов для colibri

Aymo AI logo

Универсальная AI-платформа для команд, обеспечивающая доступ к ведущим моделям ИИ, таким как GPT, Claude, Gemini и другим, в защищённом совместном рабочем пространстве.

EB

Echo — это AI-модель с открытыми весами, обеспечивающая производительность уровня Claude по цене в три раза ниже, адаптируемая для чата, кода и агентных задач.

L

LiquidBrain.ai предлагает неограниченное количество токенов и контекста для AI-инференса по фиксированной ежемесячной оплате, используя запатентованный распределенный движок для частного масштабируемого развертывания моделей.

DwarfStar logo

Специализированный локальный движок вывода для больших языковых моделей, оптимизированный для Apple Silicon и потоковой передачи с SSD в системах с ограниченной памятью.

Opper AI logo

Единый AI-шлюз, предоставляющий доступ к 300+ ведущим моделям через один API, размещенный в ЕС и соответствующий GDPR, с интерфейсом, совместимым с OpenAI SDK.

Бесплатно
Auriko logo

Единая API-платформа для вывода LLM с оптимизацией стоимости, маршрутизацией, наблюдаемостью и автоматическим переключением при сбоях.