ИИ Большие языковые модели
colibri
Движок на чистом C без зависимостей, который транслирует веса экспертов с диска для запуска 744B-параметрической модели GLM-5.2 MoE на потребительском оборудовании всего с 25 ГБ ОЗУ.
colibri
Что такое colibri?
colibri — это легковесный движок инференса на чистом C для модели Mixture-of-Experts GLM-5.2 с 744B параметрами. Он транслирует веса экспертов с диска и не требует Python, GPU или внешних зависимостей во время выполнения, что позволяет запускать локально на машине с ~25 ГБ ОЗУ.
colibri — сравнение с аналогами
| Модель ценообразования | Бесплатно | Бесплатно | Бесплатно | Бесплатно, Freemium |
| Бесплатные кредиты | ||||
| Ключевые возможности |
|
|
|
|
| Плюсы |
|
|
|
|
| Минусы |
|
|
|
|
| Кому подходит |
|
|
|
|
Как использовать colibri?
- 1Клонируйте репозиторий: git clone https://github.com/JustVugg/colibri.git
- 2Соберите движок: cd c && make
- 3Конвертируйте модель FP8 в int4: ./coli convert --model /path/to/model
- 4Запустите чат: COLI_MODEL=/path/to/model ./coli chat
- 5(Опционально) Используйте веб-интерфейс или совместимый с OpenAI сервер для графического интерфейса.
colibri Ключевые возможности
- Чистая реализация на C без внешних зависимостей
- Потоковая передача весов экспертов с диска с LRU-кэшем и опциональным закрепленным горячим хранилищем
- Точный прямой проход GLM-5.2 (glm_moe_dsa), подтвержденный до токена
- Внимание MLA со сжатым KV-кэшем (в 57 раз меньше)
- Встроенное спекулятивное декодирование MTP для до 2.8 токенов за прямой проход
- Ядра целочисленного скалярного произведения (int8/int4) с ускорением AVX2
- Обучаемый на лету кэш, который адаптируется к шаблонам использования
colibri Сценарии использования
- Запуск 744B-параметрической модели MoE на потребительском ноутбуке или ПК
- Офлайн чат и инференс без облачных зависимостей
- Исследования и эксперименты с большими архитектурами MoE
- Образовательные демонстрации возможностей передовых моделей на ограниченном оборудовании
colibri Цены и бесплатный доступ
Модель оплаты colibri: Бесплатно.
colibri Плюсы и минусы
Плюсы
- Запускает модель с 744B параметров на потребительском оборудовании всего с 25 ГБ ОЗУ
- Открытый исходный код и полная прозрачность (код на C, без зависимостей)
- Эффективная потоковая передача с диска с кэшированием позволяет длительное использование
- Активные бенчмарки и улучшения сообщества
Минусы
- Очень медленное холодное декодирование (0.05-0.1 ток/с на типичном NVMe)
- Требуется ~370 ГБ дискового пространства для конвертированной модели int4
- Поддерживает только модель GLM-5.2 (нет гибкости нескольких моделей)
- Бэкенд CUDA экспериментальный и ограниченный
Для чего лучше всего подходит colibri?
- Разработчикам, желающим запускать большие модели локально
- Исследователям ИИ, изучающим архитектуры MoE на ограниченном оборудовании
- Энтузиастам, интересующимся инференсом передовых моделей без облачных затрат