AI 대형 언어 모델 (LLM)
colibri
의존성 없는 C 엔진으로, 디스크에서 전문가 가중치를 스트리밍하여 744B 매개변수 GLM-5.2 MoE 모델을 25GB RAM만으로 소비자 하드웨어에서 실행합니다.
colibri
colibri란?
colibri는 GLM-5.2 744B 매개변수 Mixture-of-Experts 모델을 위한 경량 순수 C 추론 엔진입니다. 디스크에서 전문가 가중치를 스트리밍하며, 런타임에 Python, GPU 또는 외부 종속성이 필요 없어 약 25GB RAM의 기기에서 로컬 실행이 가능합니다.
colibri vs 유사 도구
| 가격 모델 | 무료 | 무료 | 무료 | 무료, 프리미엄 무료 |
| 무료 크레딧 | ||||
| 주요 기능 |
|
|
|
|
| 장점 |
|
|
|
|
| 단점 |
|
|
|
|
| 추천 대상 |
|
|
|
|
colibri 사용 방법
- 1저장소 클론: git clone https://github.com/JustVugg/colibri.git
- 2엔진 빌드: cd c && make
- 3FP8 모델을 int4로 변환: ./coli convert --model /path/to/model
- 4채팅 실행: COLI_MODEL=/path/to/model ./coli chat
- 5(선택 사항) 웹 UI 또는 OpenAI 호환 서버를 사용하여 그래픽 인터페이스 이용
colibri 주요 기능
- 외부 종속성이 전혀 없는 순수 C 구현
- 디스크에서 전문가 가중치 스트리밍, LRU 캐시 및 선택적 고정 핫스토어
- 정확한 GLM-5.2 (glm_moe_dsa) 순전파, 토큰 수준 검증
- 압축 KV-캐시를 사용한 MLA 어텐션 (57배 축소)
- 네이티브 MTP 추측 디코딩으로 최대 2.8 토큰/순전파
- AVX2 가속을 사용한 정수 내적 커널 (int8/int4)
- 사용 패턴에 적응하는 온라인 학습 캐시
colibri 사용 사례
- 소비자용 노트북이나 데스크탑에서 744B 매개변수 MoE 모델 실행
- 클라우드 의존성 없이 오프라인 채팅 및 추론
- 대규모 MoE 아키텍처 연구 및 실험
- 제한된 하드웨어에서 최첨단 모델 기능을 교육적으로 시연
colibri 가격 및 무료 크레딧
colibri의 가격 모델은 무료입니다.
colibri 장점과 단점
장점
- 25GB RAM만으로 소비자 하드웨어에서 744B 매개변수 모델 실행
- 오픈 소스 및 완전 투명 (C 코드, 종속성 없음)
- 캐싱을 통한 효율적인 디스크 스트리밍으로 장시간 사용 가능
- 활발한 커뮤니티 벤치마크 및 개선
단점
- 콜드 디코드가 매우 느림 (일반 NVMe에서 0.05~0.1 tok/s)
- 변환된 int4 모델에 약 370GB 디스크 공간 필요
- GLM-5.2 모델만 지원 (다중 모델 유연성 없음)
- CUDA 백엔드는 실험적이며 제한적
colibri은 어떤 용도에 가장 적합한가요?
- 로컬에서 대규모 모델을 실행하려는 개발자
- 제한된 하드웨어에서 MoE 아키텍처를 탐구하는 AI 연구자
- 클라우드 비용 없이 최첨단 모델 추론에 관심 있는 애호가