v1.77.3-stable - 以優先權為基礎的速率限制
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.77.3-stable
pip install litellm
pip install litellm==1.77.3
重點摘要
- +550 RPS 效能改進 - 針對請求處理與物件初始化的最佳化。
- 優先配額保留 - Proxy 管理員現在可以為特定金鑰保留 TPM/RPM 容量。
優先配額保留
此版本新增對優先配額保留的支援。這可讓 Proxy 管理員依不同用途保留模型容量的特定百分比。
這對於您希望確保即時用途一律獲得優先回應,而背景開發工作可以花更久時間的情境非常適合。
此版本新增對優先配額保留的支援。這可讓 Proxy 管理員 根據中繼資料優先層級,為金鑰保留 TPM/RPM 容量,確保關鍵的正式環境工作負載無論開發流量多寡都能獲得保證存取。
從這裡開始
+550 RPS 效能改進
此版本透過針對性的最佳化,帶來顯著的 RPS 改進。
我們透過修正導致頻繁快取遺漏的快取型別不一致問題,提升了 +500 RPS;此外,還透過從熱路徑移除不必要的 coroutine 檢查,再增加 +50 RPS。
新模型 / 更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | 輸入($/100萬 tokens) | 輸出($/100萬 tokens) | 功能 |
|---|---|---|---|---|---|
| SambaNova | sambanova/deepseek-v3.1 | 128K | $0.90 | $0.90 | 聊天完成 |
| SambaNova | sambanova/gpt-oss-120b | 128K | $0.72 | $0.72 | 聊天完成 |
| OVHCloud | Various models | 視情況而定 | 聯絡提供者 | 聯絡提供者 | 聊天完成 |
| CompactifAI | Various models | 視情況而定 | 聯絡提供者 | 聯絡提供者 | 聊天完成 |
| TwelveLabs | twelvelabs/marengo-embed-2.7 | 32K | $0.12 | $0.00 | 嵌入 |
功能
- OVHCloud AI Endpoints
- 新增提供者支援,具備完整模型目錄 - PR #14494
- CompactifAI
- 新增提供者整合 - PR #14532
- SambaNova
- 新增 DeepSeek v3.1 與 GPT-OSS-120B 模型 - PR #14500
- Bedrock
- Vertex AI
- Volcengine
- 修正停用時的 thinking 參數 - PR #14569
- Cohere
- 處理 Generate API 淘汰,預設改用聊天端點 - PR #14676
- TwelveLabs
- 新增 Marengo Embed 2.7 嵌入支援 - PR #14674
錯誤修正
- Bedrock
- 處理工具呼叫 invocation 中的空引數 - PR #14583
- Vertex AI
- 避免 Gemini/Vertex 中非 pickleable 物件造成的 deepcopy 當機 - PR #14418
- XAI
- 修正 grok-code 模型不支援的 stop 參數 - PR #14565
- Gemini
新提供者支援
- OVHCloud AI Endpoints
- 完整提供者整合,包含模型目錄與驗證 - PR #14494
- CompactifAI
- 新增提供者支援與文件 - PR #14532
LLM API 端點
功能
- /responses
- 一般
錯誤
- /chat/completions
- /responses
- 修正成本計算 - PR #14675
- 一般
- 修正 rate limiter AttributeError - PR #14609
支出追蹤、預算與速率限制
- Responses API 成本計算 修正 - PR #14675
- Anthropic 快取 token 定價 - 分開計算 1 小時與 5 分鐘的快取建立成本 - PR #14620, PR #14652
- 印度支那時間時區 支援預算重設 - PR #14666
- 軟性預算警示快取問題 - 已解決軟性預算警示快取問題 - PR #14491
- Dynamic Rate Limiter v3 - 優先路由改進 - PR #14734
- 強化速率限制錯誤 - 更詳細的錯誤訊息 - PR #14736
管理端點 / UI
功能
- 團隊成員服務帳戶金鑰 - 允許團隊成員查看自己建立的金鑰 - PR #14619
- JWT 團隊預設預算 - 自動為產生的團隊指派預算 - PR #14514
- SSO 存取控制群組 - 強化 token 資訊端點整合 - PR #14738
- 健康測試連接保護 - 根據模型建立權限限制存取 - PR #14650
- Amazon Bedrock Guardrail 資訊檢視 - 強化記錄視覺化 - PR #14696
錯誤修正
- SCIM v2 - 修正群組 PUSH 和 PUT 作業對不存在成員的處理 - PR #14581
- 防護欄檢視/編輯/刪除 行為修正 - PR #14622
- 記憶體內防護欄 更新失敗 - PR #14653
記錄 / 防護欄整合
功能
- DataDog
- Langfuse
- 新增 Responses API 的記錄支援 - PR #14597
- Langsmith
- Langsmith 取樣率 - 金鑰/團隊層級追蹤組態 - PR #14740
- Prometheus
- Opik
- 修正時區問題 - PR #14708
錯誤修正
防護欄
- 工具權限防護欄 - 細粒度工具存取控制 - PR #14519
- Bedrock Guardrails - 支援可選擇性防護與執行階段端點組態 - PR #14575, PR #14650
- 預設最後訊息 於防護欄中 - PR #14640
- 即使回應為 200 仍處理 AWS 例外狀況 - PR #14658
新整合
MCP 閘道
- MCP Server 別名解析 - 支援多段 URL 路徑 - PR #14558
- MCP 篩選器重新計算 - 於伺服器刪除後 - PR #14542
- MCP 閘道工具清單 改進 - PR #14695
效能 / 負載平衡 / 可靠性改進
- 在傳送
user欄位時 +500 RPS 效能提升 - PR #14616 - 透過從熱路徑中移除 iscoroutine +50 RPS - PR #14649
- init 開銷 降低 7% - PR #14689
- 通用物件池 實作,以便更佳的資源管理 - PR #14702
一般代理改善
- 用於支出記錄負載的 中段截斷 - PR #14637
安全性
- 安全性更新 - 升級 aiohttp==3.12.14,修正 CVE-2025-53643 - PR #14638
新貢獻者
- @luisfucros 首次在 PR #14500 做出貢獻
- @hanakannzashi 首次在 PR #14548 做出貢獻
- @eliasto 首次在 PR #14494 做出貢獻
- @Rasmusafj 首次在 PR #14491 做出貢獻
- @LingXuanYin 首次在 PR #14569 做出貢獻
- @ronaldpereira 首次在 PR #14613 做出貢獻
- @hula-la 首次在 PR #14534 做出貢獻
- @carlos-marchal-ph 首次在 PR #14610 做出貢獻
- @akraines 首次在 PR #14637 做出貢獻
- @mrFranklin 首次在 PR #14708 做出貢獻
- @tcx4c70 首次在 PR #14675 做出貢獻
- @michaeltansg 首次在 PR #14666 做出貢獻
- @tosi29 首次在 PR #14725 做出貢獻
- @gmdfalk 首次在 PR #14735 做出貢獻
- @FelipeRodriguesGare 首次在 PR #14733 做出貢獻
- @mritunjaysharma394 首次在 PR #14678 做出貢獻