API AI
llmproxy
พร็อกซี LLM น้ำหนักเบา ประสิทธิภาพสูง สำหรับการแคช การเฟลโอเวอร์ การติดตามค่าใช้จ่าย และการผสานรวมระหว่างผู้ให้บริการ AI ในเครื่องและคลาวด์อย่างราบรื่น
llmproxy
llmproxy คืออะไร
llmproxy เป็นเซิร์ฟเวอร์ Flask โอเพนซอร์สที่จำลอง HTTP API ของ Ollama, OpenAI และ llama.cpp โดยส่งต่อคำขอไปยัง API ที่เข้ากันได้กับ OpenAI ของ NVIDIA เพื่อการผสานรวมอย่างราบรื่นโดยไม่ต้องเปลี่ยนแปลงฝั่งไคลเอ็นต์
llmproxy เทียบกับเครื่องมือที่คล้ายคลึง
| โมเดลราคา | ฟรี | ราคาที่กำหนดเอง | ฟรี | ฟรี, ฟรีเมียม |
| เครดิตฟรี | ||||
| ฟีเจอร์หลัก |
|
|
|
|
| ข้อดี |
|
|
|
|
| ข้อจำกัด |
|
|
|
|
| เหมาะสำหรับ |
|
|
|
|
วิธีใช้ llmproxy
- 1กำหนดค่า NVIDIA API key ของคุณในไฟล์ .env
- 2รันด้วย Docker Compose: docker compose up -d
- 3ทดสอบด้วย curl: curl http://localhost:11434/
ฟีเจอร์หลักของ llmproxy
- จำลอง API ของ Ollama, OpenAI และ llama.cpp
- ส่งต่อโปร่งใสไปยัง API ที่เข้ากันได้กับ OpenAI ของ NVIDIA
- การแคชการตอบสนองแบบเลือกได้พร้อม TTL และขนาดที่กำหนดค่าได้
- การเฟลโอเวอร์และการลองใหม่อัตโนมัติเมื่อเกิดข้อผิดพลาดชั่วคราวจากต้นทาง
- แดชบอร์ด /stats แบบเรียลไทม์สำหรับตรวจสอบเมตริกและการทำงานของกระบวนการ
- รองรับการยืนยันตัวตนขาเข้า
- การค้นพบหลายโมเดล
- รองรับการสตรีมสำหรับแชทและการเติมข้อความ
เคสใช้งานของ llmproxy
- ผสานรวมเครื่องมือ LLM ในเครื่องกับโมเดลที่โฮสต์บนคลาวด์ของ NVIDIA โดยไม่ต้องปรับเปลี่ยนไคลเอ็นต์
- ตรวจสอบและติดตามค่าใช้จ่ายและการใช้งาน API ผ่านแดชบอร์ดสถิติ
- ลดความหน่วงและการเรียก API ด้วยการแคชการตอบสนองสำหรับคำขอที่ไม่ใช่สตรีม
ราคาและเครดิตฟรีของ llmproxy
llmproxy ใช้โมเดลราคาแบบ ฟรี
เครื่องมือนี้ใช้งานได้ฟรีทั้งหมด
ข้อดีและข้อจำกัดของ llmproxy
ข้อดี
- น้ำหนักเบาและปรับใช้ได้ง่ายผ่าน Docker
- แคชการตอบสนองเพื่อลดการเรียก API และความหน่วง
- การเฟลโอเวอร์และการลองใหม่อัตโนมัติช่วยเพิ่มความน่าเชื่อถือ
- ให้การติดตามค่าใช้จ่ายและเมตริกแบบเรียลไทม์
- ทำงานร่วมกับไคลเอ็นต์ที่มีอยู่ได้โดยไม่ต้องเปลี่ยนแปลง
ข้อจำกัด
- ส่งต่อเฉพาะ API ของ NVIDIA เท่านั้น ไม่รองรับผู้ให้บริการคลาวด์รายอื่น
- ต้องมีคีย์ API NVIDIA ที่ถูกต้อง
- แคชเฉพาะการตอบสนองที่ไม่ใช่สตรีม
llmproxy เหมาะกับงานแบบไหน?
- นักพัฒนาที่ผสานรวม LLM ของ NVIDIA เข้ากับเวิร์กโฟลว์ที่มีอยู่
- ผู้ใช้ Open WebUI, curl หรือ SDK ที่ต้องการใช้ประโยชน์จากโมเดลของ NVIDIA
- ทีมที่ต้องการติดตามค่าใช้จ่ายและการแคชสำหรับการเรียก LLM API