AI API 介面
llmproxy
一個輕量級、高效能的 LLM 代理,用於快取、容錯、成本追蹤,以及本地與雲端 AI 提供者之間的無縫整合。
llmproxy
什麼是 llmproxy?
llmproxy 是一個開源的 Flask 伺服器,模擬 Ollama、OpenAI 和 llama.cpp 的 HTTP API,將請求轉發至 NVIDIA 的 OpenAI 相容 API,無需用戶端變更即可實現無縫整合。
llmproxy 與相似工具比較
| 計價模式 | 免費 | 客製化定價 | 免費 | 免費, Freemium |
| 免費額度 | ||||
| 主要功能 |
|
|
|
|
| 優點 |
|
|
|
|
| 缺點 |
|
|
|
|
| 適合對象 |
|
|
|
|
如何使用 llmproxy?
- 1在 .env 檔案中設定您的 NVIDIA API 金鑰。
- 2使用 Docker Compose 執行:docker compose up -d。
- 3使用 curl 測試:curl http://localhost:11434/。
llmproxy 主要功能
- 模擬 Ollama、OpenAI 和 llama.cpp API
- 透明轉發至 NVIDIA 的 OpenAI 相容 API
- 可選的回應快取,支援可設定的 TTL 和大小
- 暫時性上游錯誤時的自動容錯與重試
- 即時 /stats 儀表板,用於指標與程序監控
- 支援入站驗證
- 多模型探索
- 支援聊天和完成的串流
llmproxy 使用情境
- 將本地 LLM 工具與 NVIDIA 雲端託管模型整合,無需用戶端修改
- 透過統計儀表板監控和追蹤 API 成本與使用量
- 透過非串流請求的回應快取減少延遲和 API 呼叫次數
llmproxy 價格與免費點數
llmproxy 目前採用 免費 模式。
此工具完全免費使用
llmproxy 優缺點
優點
- 輕量級且易於透過 Docker 部署
- 快取回應以減少 API 呼叫和延遲
- 自動容錯和重試提升可靠性
- 提供成本追蹤和即時指標
- 無需變更即可與現有用戶端搭配使用
缺點
- 僅轉發至 NVIDIA 的 API,不支援其他雲端提供者
- 需要有效的 NVIDIA API 金鑰
- 僅快取非串流回應
llmproxy 最適合哪些用途?
- 將 NVIDIA LLM 整合至現有工作流程的開發者
- 希望利用 NVIDIA 模型的 Open WebUI、curl 或 SDK 使用者
- 需要針對 LLM API 呼叫進行成本追蹤和快取的團隊