نماذج اللغات الكبيرة (LLMs) بالذكاء الاصطناعي
colibri
محرك C خالٍ من التبعيات يقوم ببث أوزان الخبراء من القرص لتشغيل نموذج GLM-5.2 MoE ذي 744 مليار معلمة على أجهزة المستهلك باستخدام 25 جيجابايت فقط من ذاكرة الوصول العشوائي.
colibri
ما هو colibri؟
colibri هو محرك استدلال خفيف الوزن بلغة C النقية لنموذج GLM-5.2 ذي 744 مليار معلمة (خبراء مختلطون). يقوم ببث أوزان الخبراء من القرص ولا يتطلب Python أو GPU أو تبعيات خارجية أثناء التشغيل، مما يتيح التنفيذ المحلي على جهاز بذاكرة وصول عشوائي تبلغ ~25 جيجابايت.
colibri مقارنة بأدوات مماثلة
| نموذج التسعير | مجاني | مجاني | مجاني | مجاني, فريميوم |
| أرصدة مجانية | ||||
| الميزات الرئيسية |
|
|
|
|
| المزايا |
|
|
|
|
| العيوب |
|
|
|
|
| مناسب لـ |
|
|
|
|
طريقة استخدام colibri
- 1استنساخ المستودع: git clone https://github.com/JustVugg/colibri.git
- 2بناء المحرك: cd c && make
- 3تحويل النموذج FP8 إلى int4: ./coli convert --model /path/to/model
- 4تشغيل الدردشة: COLI_MODEL=/path/to/model ./coli chat
- 5(اختياري) استخدام واجهة الويب أو خادم متوافق مع OpenAI للحصول على واجهة رسومية.
الميزات الرئيسية في colibri
- تنفيذ بلغة C نقية بدون أي تبعيات خارجية
- بث أوزان الخبراء من القرص مع ذاكرة تخزين مؤقت LRU وتخزين ساخن ثابت اختياري
- تمرير أمامي دقيق لـ GLM-5.2 (glm_moe_dsa) تم التحقق منه بدقة الرمز
- انتباه MLA مع ذاكرة تخزين مؤقت مضغوطة (أصغر بـ 57 مرة)
- فك تشفير تخميني MTP أصلي يصل إلى 2.8 رمز لكل تمرير أمامي
- نوى ضرب الأعداد الصحيحة (int8/int4) مع تسريع AVX2
- ذاكرة تخزين مؤقت للتعلم عبر الإنترنت تتكيف مع أنماط الاستخدام
حالات استخدام colibri
- تشغيل نموذج MoE ذي 744 مليار معلمة على كمبيوتر محمول أو مكتبي استهلاكي
- الدردشة والاستدلال دون اتصال بدون تبعيات سحابية
- البحث والتجريب مع بنى MoE الكبيرة
- عروض تعليمية لقدرات النماذج المتطورة على أجهزة محدودة
أسعار colibri والأرصدة المجانية
يعمل colibri بنموذج مجاني.
مزايا وعيوب colibri
المزايا
- تشغيل نموذج ذي 744 مليار معلمة على أجهزة المستهلك باستخدام 25 جيجابايت فقط من ذاكرة الوصول العشوائي
- مفتوح المصدر وشفاف بالكامل (رمز C، بدون تبعيات)
- البث الفعال من القرص مع التخزين المؤقت يتيح الاستخدام الطويل
- مجتمع نشط مع معايير وتحسينات
العيوب
- فك تشفير بارد بطيء جدًا (0.05-0.1 رمز/ثانية على NVMe نموذجي)
- يتطلب ~370 جيجابايت من مساحة القرص للنموذج المحول int4
- يدعم فقط نموذج GLM-5.2 (لا مرونة متعددة النماذج)
- الواجهة الخلفية CUDA تجريبية ومحدودة
لأي استخدام يناسب colibri أكثر؟
- المطورين الراغبين في تشغيل نماذج ضخمة محليًا
- باحثي الذكاء الاصطناعي المستكشفين لبنى MoE على أجهزة محدودة
- الهواة المهتمين باستدلال النماذج المتطورة دون تكاليف سحابية