โมเดลภาษาขนาดใหญ่ AI

colibri

เอ็นจิ้น C ที่ไม่มี dependencies ซึ่งสตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์เพื่อรันโมเดล GLM-5.2 MoE ขนาด 744 พันล้านพารามิเตอร์บนฮาร์ดแวร์ผู้บริโภคโดยใช้ RAM เพียง 25 GB

colibri คืออะไร

colibri เป็นเอ็นจิ้นอินเฟอร์เรนซ์แบบ C ล้วนน้ำหนักเบาสำหรับโมเดล GLM-5.2 744 พันล้านพารามิเตอร์แบบ Mixture-of-Experts โดยจะสตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์และไม่ต้องใช้ Python, GPU หรือ dependencies ภายนอกขณะรัน ทำให้สามารถทำงานในเครื่องที่มี RAM ประมาณ 25 GB

colibri เทียบกับเครื่องมือที่คล้ายคลึง

โมเดลราคาฟรีฟรี, ฟรีเมียมชำระเงินชำระเงิน
เครดิตฟรี
ฟีเจอร์หลัก
  • การใช้งาน C ล้วนโดยไม่มี dependencies ภายนอก
  • สตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์ พร้อม LRU cache และ hot-store แบบตรึงได้
  • forward pass ที่เที่ยงตรงของ GLM-5.2 (glm_moe_dsa) ผ่านการตรวจสอบทีละโทเค็น
  • เข้าถึงโมเดล AI หลายตัว (GPT, Claude, Gemini, DeepSeek, Grok ฯลฯ)
  • การทำงานร่วมกันของทีมในพื้นที่ทำงานส่วนตัว
  • รองรับการอัปโหลดไฟล์ (PDF, โค้ด, เอกสาร) พร้อมการทำความเข้าใจบริบท
  • โมเดลเดียวสำหรับทุกงาน ไม่ต้องสลับโหมด
  • API ที่เข้ากันได้กับ OpenAI
  • คุณภาพระดับ Claude Fable ในงานที่ประเมิน
  • โทเคนไม่จำกัด
  • หน้าต่างบริบทไม่จำกัด
  • ราคารายเดือนคงที่
ข้อดี
  • รันโมเดล 744 พันล้านพารามิเตอร์บนฮาร์ดแวร์ผู้บริโภคด้วย RAM เพียง 25 GB
  • โอเพนซอร์สและโปร่งใสอย่างสมบูรณ์ (โค้ด C ไม่มี dependencies)
  • เข้าถึงโมเดล AI ชั้นนำหลายตัวในแพลตฟอร์มเดียว
  • ฟีเจอร์การทำงานร่วมกันของทีมในตัว
  • คุณภาพสูงเทียบเท่า Claude Fable
  • ต้นทุนต่ำกว่าโมเดลระดับแนวหน้าอย่างมาก
  • โทเคนและบริบทไม่จำกัด
  • ราคาคงที่คาดการณ์ได้
ข้อจำกัด
  • การถอดรหัสครั้งแรกช้ามาก (0.05-0.1 tok/s บน NVMe ทั่วไป)
  • ต้องใช้พื้นที่ดิสก์ประมาณ 370 GB สำหรับโมเดล int4 ที่แปลงแล้ว
  • ข้อความและเครดิตจำกัดในแผนฟรี
  • ฟีเจอร์ขั้นสูงต้องสมัครสมาชิกแบบชำระเงิน
  • โมเดลใหม่กว่าพร้อมการตรวจสอบอิสระที่จำกัด
  • ราคาที่แน่นอนไม่ได้เปิดเผยต่อสาธารณะ
  • ค่าใช้จ่ายรายเดือนสูง ($10K+)
  • ต้องใช้เวลาเตรียมการ 14 วัน
เหมาะสำหรับ
  • นักพัฒนาที่ต้องการรันโมเดลขนาดใหญ่ในเครื่อง
  • นักวิจัย AI ที่สำรวจสถาปัตยกรรม MoE บนฮาร์ดแวร์ที่มีข้อจำกัด
  • ทีมที่ต้องการเข้าถึงโมเดล AI ที่หลากหลาย
  • ผู้สร้างเนื้อหาและนักวิจัย
  • นักพัฒนาที่ต้องการ LLM คุณภาพสูงในราคาต่ำ
  • ทีมที่ต้องการโมเดลอเนกประสงค์ตัวเดียว
  • ทีมองค์กรที่รันเอเจนต์ AI ในขนาดใหญ่
  • ทีมวิศวกรรมซอฟต์แวร์ที่ต้องการสร้างโค้ดระยะยาว

วิธีใช้ colibri

  1. 1โคลนที่เก็บ: git clone https://github.com/JustVugg/colibri.git
  2. 2สร้างเอ็นจิ้น: cd c && make
  3. 3แปลงโมเดล FP8 เป็น int4: ./coli convert --model /path/to/model
  4. 4เริ่มแชท: COLI_MODEL=/path/to/model ./coli chat
  5. 5(ตัวเลือก) ใช้เว็บ UI หรือเซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI สำหรับอินเทอร์เฟซแบบกราฟิก

ฟีเจอร์หลักของ colibri

  • การใช้งาน C ล้วนโดยไม่มี dependencies ภายนอก
  • สตรีมน้ำหนักผู้เชี่ยวชาญจากดิสก์ พร้อม LRU cache และ hot-store แบบตรึงได้
  • forward pass ที่เที่ยงตรงของ GLM-5.2 (glm_moe_dsa) ผ่านการตรวจสอบทีละโทเค็น
  • attention แบบ MLA พร้อม KV-cache ที่ถูกบีบอัด (เล็กกว่า 57 เท่า)
  • การถอดรหัสแบบคาดเดา MTP ดั้งเดิมสำหรับสูงสุด 2.8 โทเค็นต่อ forward
  • เคอร์เนล Integer-dot (int8/int4) พร้อมการเร่งด้วย AVX2
  • แคชการเรียนรู้แบบออนไลน์ที่ปรับตามรูปแบบการใช้งาน

เคสใช้งานของ colibri

  • การรันโมเดล MoE 744 พันล้านพารามิเตอร์บนแล็ปท็อปหรือเดสก์ท็อปสำหรับผู้บริโภค
  • การแชทและอินเฟอร์เรนซ์แบบออฟไลน์โดยไม่ต้องพึ่งพาคลาวด์
  • การวิจัยและทดลองกับสถาปัตยกรรม MoE ขนาดใหญ่
  • การสาธิตทางการศึกษาถึงความสามารถของโมเดลชั้นนำบนฮาร์ดแวร์ที่มีข้อจำกัด

ราคาและเครดิตฟรีของ colibri

colibri ใช้โมเดลราคาแบบ ฟรี

โอเพนซอร์ส

ฟรี

ใบอนุญาต Apache 2.0 ไม่มีค่าใช้จ่ายสำหรับการใช้งานหรือการปรับเปลี่ยน

ข้อดีและข้อจำกัดของ colibri

ข้อดี

  • รันโมเดล 744 พันล้านพารามิเตอร์บนฮาร์ดแวร์ผู้บริโภคด้วย RAM เพียง 25 GB
  • โอเพนซอร์สและโปร่งใสอย่างสมบูรณ์ (โค้ด C ไม่มี dependencies)
  • การสตรีมจากดิสก์อย่างมีประสิทธิภาพพร้อมแคชทำให้ใช้งานต่อเนื่องยาวนาน
  • ชุมชนที่กระตือรือร้นในการวัดประสิทธิภาพและปรับปรุง

ข้อจำกัด

  • การถอดรหัสครั้งแรกช้ามาก (0.05-0.1 tok/s บน NVMe ทั่วไป)
  • ต้องใช้พื้นที่ดิสก์ประมาณ 370 GB สำหรับโมเดล int4 ที่แปลงแล้ว
  • รองรับเฉพาะโมเดล GLM-5.2 (ไม่มีความยืดหยุ่นหลายโมเดล)
  • CUDA backend เป็นการทดลองและมีข้อจำกัด

colibri เหมาะกับงานแบบไหน?

  • นักพัฒนาที่ต้องการรันโมเดลขนาดใหญ่ในเครื่อง
  • นักวิจัย AI ที่สำรวจสถาปัตยกรรม MoE บนฮาร์ดแวร์ที่มีข้อจำกัด
  • ผู้ที่สนใจการอนุมานโมเดลชั้นนำโดยไม่มีค่าใช้จ่ายคลาวด์

คำถามที่พบบ่อยเกี่ยวกับ colibri

ตัวเลือกฟรีทดแทน colibri

Opper AI logo

เกตเวย์ AI แบบรวมศูนย์ที่ให้การเข้าถึงโมเดลชั้นนำกว่า 300 รุ่นผ่าน API เดียวที่โฮสต์ในสหภาพยุโรปและเป็นไปตาม GDPR พร้อมอินเทอร์เฟซที่เข้ากันได้กับ OpenAI SDK

ฟรี
discode.ai logo

อินเทอร์เฟซแชทเดียวที่ให้คุณเข้าถึงโมเดล AI กว่า 100 รุ่น โดยเลือกโมเดลที่ดีที่สุดสำหรับงานของคุณโดยอัตโนมัติ พร้อมติดตามการใช้พลังงานและปกป้องความเป็นส่วนตัวของคุณ

ฟรี
Oxlo.ai logo

Oxlo.ai คือ API การอนุมาน AI ที่ให้ความสำคัญกับความเป็นส่วนตัว โดยเสนอราคาตามคำขอสำหรับโมเดลโอเพนซอร์สกว่า 45 รายการ

ฟรี
Graphsignal logo

Graphsignal เป็นแพลตฟอร์มการทำโปรไฟล์การอนุมานระดับการผลิตที่ช่วยให้วิศวกรปรับปรุงประสิทธิภาพ AI ในโมเดล เอ็นจิน GPU และตัวเร่งอื่นๆ

ฟรี
Groq logo

Groq มอบการทำ inference ของ AI ที่รวดเร็วและต้นทุนต่ำผ่าน GroqCloud และสแต็ก LPU แบบเฉพาะของบริษัท

ฟรี

ตัวเลือก AI ทดแทนที่ดีที่สุดสำหรับ colibri

Aymo AI logo

แพลตฟอร์ม AI แบบครบวงจรสำหรับทีม ให้เข้าถึงโมเดล AI ชั้นนำ เช่น GPT, Claude, Gemini และอื่นๆ ในพื้นที่การทำงานร่วมกันที่ปลอดภัย

EB

Echo คือโมเดล AI แบบโอเพนเวทที่มอบประสิทธิภาพระดับ Claude ด้วยต้นทุนหนึ่งในสาม ปรับเปลี่ยนได้กับงานแชท โค้ด และเอเจนต์

L

LiquidBrain.ai นำเสนอการอนุมาน AI ด้วยโทเคนและบริบทไม่จำกัดในรูปแบบค่าธรรมเนียมรายเดือนคงที่ โดยใช้เอนจิ้นการอนุมานแบบกระจายที่จดสิทธิบัตรสำหรับการปรับใช้โมเดลแบบส่วนตัวและปรับขนาดได้

DwarfStar logo

เครื่องมืออนุมานในเครื่องเฉพาะทางสำหรับโมเดลภาษาขนาดใหญ่ ที่ปรับให้เหมาะสมกับ Apple Silicon และการสตรีมจาก SSD บนระบบที่มีหน่วยความจำจำกัด

Opper AI logo

เกตเวย์ AI แบบรวมศูนย์ที่ให้การเข้าถึงโมเดลชั้นนำกว่า 300 รุ่นผ่าน API เดียวที่โฮสต์ในสหภาพยุโรปและเป็นไปตาม GDPR พร้อมอินเทอร์เฟซที่เข้ากันได้กับ OpenAI SDK

ฟรี
Auriko logo

แพลตฟอร์ม API แบบรวมสำหรับการอนุมาน LLM พร้อมการปรับต้นทุน การจัดเส้นทาง การสังเกตการณ์ และการเฟลโอเวอร์อัตโนมัติ