API AI

llmproxy

พร็อกซี LLM น้ำหนักเบา ประสิทธิภาพสูง สำหรับการแคช การเฟลโอเวอร์ การติดตามค่าใช้จ่าย และการผสานรวมระหว่างผู้ให้บริการ AI ในเครื่องและคลาวด์อย่างราบรื่น

llmproxy คืออะไร

llmproxy เป็นเซิร์ฟเวอร์ Flask โอเพนซอร์สที่จำลอง HTTP API ของ Ollama, OpenAI และ llama.cpp โดยส่งต่อคำขอไปยัง API ที่เข้ากันได้กับ OpenAI ของ NVIDIA เพื่อการผสานรวมอย่างราบรื่นโดยไม่ต้องเปลี่ยนแปลงฝั่งไคลเอ็นต์

llmproxy เทียบกับเครื่องมือที่คล้ายคลึง

โมเดลราคาฟรีราคาที่กำหนดเองฟรีฟรี, ฟรีเมียม
เครดิตฟรี
ฟีเจอร์หลัก
  • จำลอง API ของ Ollama, OpenAI และ llama.cpp
  • ส่งต่อโปร่งใสไปยัง API ที่เข้ากันได้กับ OpenAI ของ NVIDIA
  • การแคชการตอบสนองแบบเลือกได้พร้อม TTL และขนาดที่กำหนดค่าได้
  • รันไทม์ระดับองค์กรที่มีความพร้อมใช้งานสูง
  • ข้อมูลประจำตัวและการเข้าถึงที่ยืดหยุ่น (SAML, OAuth)
  • การแยกผู้เช่าด้วยรันไทม์ ข้อมูลประจำตัว และเส้นทางการตรวจสอบที่แยกกัน
  • การฉีดข้อมูลประจำตัวอย่างโปร่งใสสำหรับเอเจนต์ AI
  • การจัดเก็บความลับที่เข้ารหัส AES-256-GCM ในขณะพัก
  • การจับคู่โฮสต์และพาธสำหรับกำหนดเส้นทางความลับไปยังเอนด์พอยท์
  • การเข้ารหัสจากต้นทางถึงปลายทางด้วย AES-256-GCM
  • การถ่ายโอนไฟล์ระหว่าง agent ผ่าน MCP
  • อัปโหลดไฟล์สูงสุด 100 MB
ข้อดี
  • น้ำหนักเบาและปรับใช้ได้ง่ายผ่าน Docker
  • แคชการตอบสนองเพื่อลดการเรียก API และความหน่วง
  • ความปลอดภัยและการกำกับดูแลระดับองค์กรในตัว
  • การแยกผู้เช่าแบบหลายผู้เช่าสำหรับผู้ให้บริการ SaaS
  • โอเพนซอร์สและโฮสต์เอง ทำให้ควบคุมข้อมูลประจำตัวได้เต็มที่
  • ติดตั้งง่ายด้วยคำสั่งเดียวหรือ Docker
  • การเข้ารหัสจากต้นทางถึงปลายทาง
  • ไม่มีข้อความธรรมดาฝั่งเซิร์ฟเวอร์
ข้อจำกัด
  • ส่งต่อเฉพาะ API ของ NVIDIA เท่านั้น ไม่รองรับผู้ให้บริการคลาวด์รายอื่น
  • ต้องมีคีย์ API NVIDIA ที่ถูกต้อง
  • ราคาไม่โปร่งใสและต้องติดต่อฝ่ายขาย
  • ต้องใช้ความเชี่ยวชาญทางเทคนิคในการตั้งค่าและกำหนดค่าเวิร์กโฟลว์
  • ปัจจุบันจำกัดเฉพาะโหมดผู้ใช้คนเดียวในเครื่องเป็นค่าเริ่มต้น การตั้งค่า OAuth ต้องการการกำหนดค่าเพิ่มเติม
  • ต้องมีโครงสร้างพื้นฐานสำหรับโฮสต์เอง (Docker/PostgreSQL)
  • จำกัดที่ 100 MB ในระดับฟรี
  • ลิงก์หมดอายุหลังจาก 24 ชั่วโมง (อาจสั้นเกินไปสำหรับบางคน)
เหมาะสำหรับ
  • นักพัฒนาที่ผสานรวม LLM ของ NVIDIA เข้ากับเวิร์กโฟลว์ที่มีอยู่
  • ผู้ใช้ Open WebUI, curl หรือ SDK ที่ต้องการใช้ประโยชน์จากโมเดลของ NVIDIA
  • องค์กรที่ต้องการแพลตฟอร์มการรวมระบบที่ปลอดภัยและสามารถกำกับดูแลได้
  • บริษัท SaaS ที่ต้องการการรวมระบบแบบหลายผู้เช่าสำหรับลูกค้า
  • นักพัฒนาที่สร้างเอเจนต์ AI ที่ต้องการการเข้าถึง API อย่างปลอดภัย
  • ทีมที่จัดการการปรับใช้เอเจนต์ AI หลายตัวที่มีขอบเขตข้อมูลประจำตัวแตกต่างกัน
  • นักพัฒนา AI agent
  • ทีม DevOps ที่ทำงานอัตโนมัติในการถ่ายโอนไฟล์ระหว่าง agent

วิธีใช้ llmproxy

  1. 1กำหนดค่า NVIDIA API key ของคุณในไฟล์ .env
  2. 2รันด้วย Docker Compose: docker compose up -d
  3. 3ทดสอบด้วย curl: curl http://localhost:11434/

ฟีเจอร์หลักของ llmproxy

  • จำลอง API ของ Ollama, OpenAI และ llama.cpp
  • ส่งต่อโปร่งใสไปยัง API ที่เข้ากันได้กับ OpenAI ของ NVIDIA
  • การแคชการตอบสนองแบบเลือกได้พร้อม TTL และขนาดที่กำหนดค่าได้
  • การเฟลโอเวอร์และการลองใหม่อัตโนมัติเมื่อเกิดข้อผิดพลาดชั่วคราวจากต้นทาง
  • แดชบอร์ด /stats แบบเรียลไทม์สำหรับตรวจสอบเมตริกและการทำงานของกระบวนการ
  • รองรับการยืนยันตัวตนขาเข้า
  • การค้นพบหลายโมเดล
  • รองรับการสตรีมสำหรับแชทและการเติมข้อความ

เคสใช้งานของ llmproxy

  • ผสานรวมเครื่องมือ LLM ในเครื่องกับโมเดลที่โฮสต์บนคลาวด์ของ NVIDIA โดยไม่ต้องปรับเปลี่ยนไคลเอ็นต์
  • ตรวจสอบและติดตามค่าใช้จ่ายและการใช้งาน API ผ่านแดชบอร์ดสถิติ
  • ลดความหน่วงและการเรียก API ด้วยการแคชการตอบสนองสำหรับคำขอที่ไม่ใช่สตรีม

ราคาและเครดิตฟรีของ llmproxy

llmproxy ใช้โมเดลราคาแบบ ฟรี

เครื่องมือนี้ใช้งานได้ฟรีทั้งหมด

ฟรี

$0

โอเพนซอร์สภายใต้สัญญาอนุญาต MIT

ข้อดีและข้อจำกัดของ llmproxy

ข้อดี

  • น้ำหนักเบาและปรับใช้ได้ง่ายผ่าน Docker
  • แคชการตอบสนองเพื่อลดการเรียก API และความหน่วง
  • การเฟลโอเวอร์และการลองใหม่อัตโนมัติช่วยเพิ่มความน่าเชื่อถือ
  • ให้การติดตามค่าใช้จ่ายและเมตริกแบบเรียลไทม์
  • ทำงานร่วมกับไคลเอ็นต์ที่มีอยู่ได้โดยไม่ต้องเปลี่ยนแปลง

ข้อจำกัด

  • ส่งต่อเฉพาะ API ของ NVIDIA เท่านั้น ไม่รองรับผู้ให้บริการคลาวด์รายอื่น
  • ต้องมีคีย์ API NVIDIA ที่ถูกต้อง
  • แคชเฉพาะการตอบสนองที่ไม่ใช่สตรีม

llmproxy เหมาะกับงานแบบไหน?

  • นักพัฒนาที่ผสานรวม LLM ของ NVIDIA เข้ากับเวิร์กโฟลว์ที่มีอยู่
  • ผู้ใช้ Open WebUI, curl หรือ SDK ที่ต้องการใช้ประโยชน์จากโมเดลของ NVIDIA
  • ทีมที่ต้องการติดตามค่าใช้จ่ายและการแคชสำหรับการเรียก LLM API

คำถามที่พบบ่อยเกี่ยวกับ llmproxy

ตัวเลือกฟรีทดแทน llmproxy

YAFL logo

เครื่องมือถ่ายโอนไฟล์ที่เน้นตัวแทน (agent-first) ที่ช่วยให้การแชร์ไฟล์ระหว่าง AI agent ด้วยการเรียก MCP อย่างปลอดภัยและเข้ารหัส โดยไม่ต้องมีมนุษย์เกี่ยวข้อง

ฟรี
TwelveLabs logo

TwelveLabs คือแพลตฟอร์มวิดีโออัจฉริยะที่ช่วยให้นักพัฒนาสามารถค้นหา วิเคราะห์ และทำความเข้าใจเนื้อหาวิดีโอโดยใช้โมเดล AI ที่ทรงพลังผ่าน API

ฟรี
Agentcard logo

Agentcard มอบโครงสร้างพื้นฐานการออกบัตรและการชำระเงินที่เหมาะกับเอเจนต์สำหรับ AI agent ช่วยให้ตั้งค่าได้ภายใน 5 นาทีและสามารถซื้อสินค้าแบบอัตโนมัติ

ฟรี
Opper AI logo

เกตเวย์ AI แบบรวมศูนย์ที่ให้การเข้าถึงโมเดลชั้นนำกว่า 300 รุ่นผ่าน API เดียวที่โฮสต์ในสหภาพยุโรปและเป็นไปตาม GDPR พร้อมอินเทอร์เฟซที่เข้ากันได้กับ OpenAI SDK

ฟรี
D

ไดค์คือเกตเวย์ปฏิบัติตามข้อกำหนดสำหรับผลิตภัณฑ์ AI ในสหภาพยุโรป โดยให้การบันทึกในระดับการตรวจสอบ การดูแลโดยมนุษย์ และการรายงานเหตุการณ์ผ่านพร็อกซีที่เรียบง่าย

ฟรี
Music0 AI logo

เครื่องกำเนิดเพลง AI ฟรีและตัวสร้างมิวสิควิดีโอที่สร้างเพลงต้นฉบับในทุกแนวเพลงและเปลี่ยนเป็นมิวสิควิดีโอที่สวยงามพร้อมภาพที่สอดประสานกัน

ฟรี
XSDR logo

โครงสร้างพื้นฐานการตรวจสอบเหตุการณ์แบบเรียลไทม์สำหรับ AI agent ที่ส่งสตรีมข้อมูลความหน่วงต่ำและการแจ้งเตือนผ่าน webhook เพื่อกระตุ้นเวิร์กโฟลว์อัตโนมัติ

ฟรี

ตัวเลือก AI ทดแทนที่ดีที่สุดสำหรับ llmproxy

Koodisi logo

Koodisi เป็นแพลตฟอร์ม iPaaS ระดับองค์กรและระบบอัตโนมัติของเวิร์กโฟลว์ที่เชื่อมต่อ API, เซิร์ฟเวอร์ MCP และเอเจนต์ AI พร้อมด้วยความปลอดภัย การกำกับดูแล และการแยกผู้เช่าในตัว

OneCLI logo

เกตเวย์ข้อมูลประจำตัวแบบโอเพนซอร์สและห้องนิรภัยสำหรับความลับที่ช่วยให้เอเจนต์ AI เข้าถึง API โดยไม่ต้องเปิดเผยคีย์

YAFL logo

เครื่องมือถ่ายโอนไฟล์ที่เน้นตัวแทน (agent-first) ที่ช่วยให้การแชร์ไฟล์ระหว่าง AI agent ด้วยการเรียก MCP อย่างปลอดภัยและเข้ารหัส โดยไม่ต้องมีมนุษย์เกี่ยวข้อง

ฟรี
Millwright logo

Millwright เป็นเราเตอร์โอเพนซอร์สที่โฮสต์ด้วยตนเอง ซึ่งกำหนดเส้นทางคำขอ AI ไปยังผู้ให้บริการโมเดลที่ถูกที่สุดตามนโยบาย รักษาแคชพรอมต์และควบคุมค่าใช้จ่าย

TwelveLabs logo

TwelveLabs คือแพลตฟอร์มวิดีโออัจฉริยะที่ช่วยให้นักพัฒนาสามารถค้นหา วิเคราะห์ และทำความเข้าใจเนื้อหาวิดีโอโดยใช้โมเดล AI ที่ทรงพลังผ่าน API

ฟรี
FlexInference logo

เราเตอร์ LLM ที่คำนึงถึงกำหนดเวลา ซึ่งลดต้นทุนการอนุมาน AI โดยค้นหาระดับบริการที่ถูกกว่าโดยอัตโนมัติภายในกรอบเวลาที่ผู้ใช้กำหนด

Agentcard logo

Agentcard มอบโครงสร้างพื้นฐานการออกบัตรและการชำระเงินที่เหมาะกับเอเจนต์สำหรับ AI agent ช่วยให้ตั้งค่าได้ภายใน 5 นาทีและสามารถซื้อสินค้าแบบอัตโนมัติ

ฟรี