واجهة برمجة تطبيقات الذكاء الاصطناعي
llmproxy
وكيل خفيف وعالي الأداء لـ LLM للتخزين المؤقت، وتجاوز الفشل، وتتبع التكاليف، والتكامل السلس بين موفري الذكاء الاصطناعي المحليين والسحابيين.
llmproxy
ما هو llmproxy؟
llmproxy هو خادم Flask مفتوح المصدر يحاكي واجهات HTTP الخاصة بـ Ollama وOpenAI وllama.cpp، ويعيد توجيه الطلبات إلى واجهة NVIDIA المتوافقة مع OpenAI للتكامل السلس دون تغييرات من جانب العميل.
llmproxy مقارنة بأدوات مماثلة
| نموذج التسعير | مجاني | تسعير مخصص | مجاني | مجاني, فريميوم |
| أرصدة مجانية | ||||
| الميزات الرئيسية |
|
|
|
|
| المزايا |
|
|
|
|
| العيوب |
|
|
|
|
| مناسب لـ |
|
|
|
|
طريقة استخدام llmproxy
- 1قم بتكوين مفتاح NVIDIA API في ملف .env.
- 2قم بتشغيله باستخدام Docker Compose: docker compose up -d.
- 3اختبر باستخدام curl: curl http://localhost:11434/.
الميزات الرئيسية في llmproxy
- محاكاة واجهات Ollama وOpenAI وllama.cpp
- إعادة توجيه شفافة إلى واجهة NVIDIA المتوافقة مع OpenAI
- تخزين مؤقت اختياري للاستجابات مع مدة صلاحية وحجم قابلين للتكوين
- تجاوز الفشل وإعادة المحاولة تلقائيًا عند أخطاء المصب المؤقتة
- لوحة معلومات /stats للقياسات ومراقبة العملية
- دعم المصادقة الواردة
- اكتشاف نماذج متعددة
- دعم البث للمحادثة والإكمال
حالات استخدام llmproxy
- دمج أدوات LLM المحلية مع نماذج NVIDIA المستضافة على السحابة بدون تعديلات على العميل
- مراقبة وتتبع تكاليف واستخدام API عبر لوحة المعلومات
- تقليل زمن الانتقال واستدعاءات API باستخدام التخزين المؤقت للاستجابات لطلبات غير البث
أسعار llmproxy والأرصدة المجانية
يعمل llmproxy بنموذج مجاني.
هذه الأداة مجانية بالكامل
مزايا وعيوب llmproxy
المزايا
- خفيف وسهل النشر عبر Docker
- يخزن الاستجابات مؤقتًا لتقليل استدعاءات API وزمن الانتقال
- تجاوز الفشل وإعادة المحاولة التلقائيان يحسنان الموثوقية
- يوفر تتبع التكاليف وقياسات حية
- يعمل مع العملاء الحاليين دون تغييرات
العيوب
- يعيد التوجيه فقط إلى API NVIDIA؛ لا يدعم موفري سحابة آخرين
- يتطلب مفتاح NVIDIA API صالحًا
- التخزين المؤقت فقط للاستجابات غير البثية
لأي استخدام يناسب llmproxy أكثر؟
- المطورين الذين يدمجون نماذج NVIDIA LLM في سير العمل الحالي
- مستخدمي Open WebUI أو curl أو SDKs الذين يرغبون في الاستفادة من نماذج NVIDIA
- الفرق التي تحتاج إلى تتبع التكاليف والتخزين المؤقت لاستدعاءات API LLM