AI API 接口
llmproxy
一个轻量级高性能LLM代理,用于缓存、故障转移、成本跟踪,并在本地和云端AI提供商之间无缝集成。
llmproxy
什么是 llmproxy?
llmproxy是一个开源Flask服务器,模拟Ollama、OpenAI和llama.cpp的HTTP API,将请求转发到NVIDIA的OpenAI兼容API,实现无需客户端更改的无缝集成。
llmproxy 与相似工具比较
| 计价模式 | 免费 | 定制定价 | 免费 | 免费, Freemium |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 llmproxy?
- 1在.env文件中配置您的NVIDIA API密钥。
- 2使用Docker Compose运行:docker compose up -d。
- 3使用curl测试:curl http://localhost:11434/。
llmproxy 主要功能
- 模拟Ollama、OpenAI和llama.cpp的API
- 透明转发到NVIDIA的OpenAI兼容API
- 可选响应缓存,可配置TTL和大小
- 临时上游错误时自动故障转移和重试
- 实时/stats仪表盘,用于指标和进程监控
- 支持入站认证
- 多模型发现
- 支持聊天和补全的流式传输
llmproxy 使用场景
- 无需修改客户端,将本地LLM工具与NVIDIA云托管模型集成
- 通过统计仪表盘监控和跟踪API成本和使用情况
- 对非流式请求使用响应缓存,减少延迟和API调用
llmproxy 价格与免费额度
llmproxy 目前采用 免费 模式。
此工具完全免费使用
llmproxy 优缺点
优点
- 轻量且易于通过Docker部署
- 缓存响应以减少API调用和延迟
- 自动故障转移和重试提高可靠性
- 提供成本跟踪和实时指标
- 无需更改现有客户端即可使用
缺点
- 仅转发到NVIDIA的API,不支持其他云提供商
- 需要有效的NVIDIA API密钥
- 仅对非流式响应进行缓存
llmproxy 最适合哪些用途?
- 将NVIDIA LLM集成到现有工作流程中的开发者
- 使用Open WebUI、curl或SDK并希望利用NVIDIA模型的用户
- 需要LLM API调用成本跟踪和缓存的团队