โมเดลภาษาขนาดใหญ่ AI
colibri
เอ็นจิ้น C ที่ไม่มี dependencies ซึ่งสตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์เพื่อรันโมเดล GLM-5.2 MoE ขนาด 744 พันล้านพารามิเตอร์บนฮาร์ดแวร์ผู้บริโภคโดยใช้ RAM เพียง 25 GB
colibri
colibri คืออะไร
colibri เป็นเอ็นจิ้นอินเฟอร์เรนซ์แบบ C ล้วนน้ำหนักเบาสำหรับโมเดล GLM-5.2 744 พันล้านพารามิเตอร์แบบ Mixture-of-Experts โดยจะสตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์และไม่ต้องใช้ Python, GPU หรือ dependencies ภายนอกขณะรัน ทำให้สามารถทำงานในเครื่องที่มี RAM ประมาณ 25 GB
colibri เทียบกับเครื่องมือที่คล้ายคลึง
| โมเดลราคา | ฟรี | ฟรี | ฟรี | ฟรี, ฟรีเมียม |
| เครดิตฟรี | ||||
| ฟีเจอร์หลัก |
|
|
|
|
| ข้อดี |
|
|
|
|
| ข้อจำกัด |
|
|
|
|
| เหมาะสำหรับ |
|
|
|
|
วิธีใช้ colibri
- 1โคลนที่เก็บ: git clone https://github.com/JustVugg/colibri.git
- 2สร้างเอ็นจิ้น: cd c && make
- 3แปลงโมเดล FP8 เป็น int4: ./coli convert --model /path/to/model
- 4เริ่มแชท: COLI_MODEL=/path/to/model ./coli chat
- 5(ตัวเลือก) ใช้เว็บ UI หรือเซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI สำหรับอินเทอร์เฟซแบบกราฟิก
ฟีเจอร์หลักของ colibri
- การใช้งาน C ล้วนโดยไม่มี dependencies ภายนอก
- สตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์ พร้อม LRU cache และ hot-store แบบตรึงได้
- forward pass ที่เที่ยงตรงของ GLM-5.2 (glm_moe_dsa) ผ่านการตรวจสอบทีละโทเค็น
- attention แบบ MLA พร้อม KV-cache ที่ถูกบีบอัด (เล็กกว่า 57 เท่า)
- การถอดรหัสแบบคาดเดา MTP ดั้งเดิมสำหรับสูงสุด 2.8 โทเค็นต่อ forward
- เคอร์เนล Integer-dot (int8/int4) พร้อมการเร่งด้วย AVX2
- แคชการเรียนรู้แบบออนไลน์ที่ปรับตามรูปแบบการใช้งาน
เคสใช้งานของ colibri
- การรันโมเดล MoE 744 พันล้านพารามิเตอร์บนแล็ปท็อปหรือเดสก์ท็อปสำหรับผู้บริโภค
- การแชทและอินเฟอร์เรนซ์แบบออฟไลน์โดยไม่ต้องพึ่งพาคลาวด์
- การวิจัยและทดลองกับสถาปัตยกรรม MoE ขนาดใหญ่
- การสาธิตทางการศึกษาถึงความสามารถของโมเดลชั้นนำบนฮาร์ดแวร์ที่มีข้อจำกัด
ราคาและเครดิตฟรีของ colibri
colibri ใช้โมเดลราคาแบบ ฟรี
ข้อดีและข้อจำกัดของ colibri
ข้อดี
- รันโมเดล 744 พันล้านพารามิเตอร์บนฮาร์ดแวร์ผู้บริโภคด้วย RAM เพียง 25 GB
- โอเพนซอร์สและโปร่งใสอย่างสมบูรณ์ (โค้ด C ไม่มี dependencies)
- การสตรีมจากดิสก์อย่างมีประสิทธิภาพพร้อมแคชทำให้ใช้งานต่อเนื่องยาวนาน
- ชุมชนที่กระตือรือร้นในการวัดประสิทธิภาพและปรับปรุง
ข้อจำกัด
- การถอดรหัสครั้งแรกช้ามาก (0.05-0.1 tok/s บน NVMe ทั่วไป)
- ต้องใช้พื้นที่ดิสก์ประมาณ 370 GB สำหรับโมเดล int4 ที่แปลงแล้ว
- รองรับเฉพาะโมเดล GLM-5.2 (ไม่มีความยืดหยุ่นหลายโมเดล)
- CUDA backend เป็นการทดลองและมีข้อจำกัด
colibri เหมาะกับงานแบบไหน?
- นักพัฒนาที่ต้องการรันโมเดลขนาดใหญ่ในเครื่อง
- นักวิจัย AI ที่สำรวจสถาปัตยกรรม MoE บนฮาร์ดแวร์ที่มีข้อจำกัด
- ผู้ที่สนใจการอนุมานโมเดลชั้นนำโดยไม่มีค่าใช้จ่ายคลาวด์