v1.77.7-stable - 中位延遲降低 2.9 倍
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.77.7.rc.1
pip install litellm
pip install litellm==1.77.7.rc.1
主要亮點
- 動態速率限制器 v3 - 當容量可用(< 80% 飽和)時,會自動透過允許較低優先級請求使用未使用的容量來最大化吞吐量,之後在高負載(≥ 80%)時切換為依優先級的公平分配,以防止阻塞
- 重大效能改進 - 在 1,000 名並行使用者下,中位延遲降低 2.9 倍。
- Claude Sonnet 4.5 - 支援 Anthropic 新的 Claude Sonnet 4.5 模型家族,具備 200K+ 上下文與分級定價
- MCP 閘道增強 - 細粒度工具控制、伺服器權限與可轉發標頭
- AMD Lemonade 與 Nvidia NIM - 新增對 AMD Lemonade 與 Nvidia NIM Rerank 的提供者支援
- GitLab 提示詞管理 - 基於 GitLab 的提示詞管理整合
效能 - 中位延遲降低 2.9 倍
這次更新移除了 LiteLLM 路由器的低效率,將複雜度從 O(M×N) 降到 O(1)。先前,它會建立新的陣列,並反覆執行像 data["model"] in llm_router.get_model_ids() 這類檢查。現在,直接的 ID 對部署映射消除了多餘的配置與掃描。
因此,各延遲百分位的效能都有所提升:
- 中位延遲: 320 ms → 110 ms(−65.6%)
- p95 延遲: 850 ms → 440 ms(−48.2%)
- p99 延遲: 1,400 ms → 810 ms(−42.1%)
- 平均延遲: 864 ms → 310 ms(−64%)
測試設定
Locust
- 並行使用者: 1,000
- 漸增: 500
系統規格
- CPU: 4 vCPUs
- 記憶體: 8 GB RAM
- LiteLLM Workers: 4
- Instances: 4
設定(config.yaml)
查看完整設定:gist.github.com/AlexsanderHamir/config.yaml
負載腳本(no_cache_hits.py)
查看完整負載測試腳本:gist.github.com/AlexsanderHamir/no_cache_hits.py
MCP OAuth 2.0 支援
此版本新增對 MCP 伺服器 OAuth 2.0 Client Credentials 的支援。這對內部開發工具使用案例非常實用,因為它可讓您的使用者使用自己的憑證來呼叫 MCP 伺服器。例如,讓您的開發人員使用自己的憑證呼叫 Github MCP。
排程式金鑰輪替
此版本為 LiteLLM AI Gateway 帶來可排程的虛擬金鑰輪替支援。
從此版本起,您可以強制虛擬金鑰依照您選擇的排程輪替,例如每 15 天 / 30 天 / 60 天等。
這對需要為正式環境工作負載強制執行安全性政策的 Proxy 管理員非常實用。
新模型 / 更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | 輸入($/1M tokens) | 輸出($/1M tokens) | 功能 |
|---|---|---|---|---|---|
| Anthropic | claude-sonnet-4-5 | 200K | $3.00 | $15.00 | 聊天、推理、視覺、函式呼叫、提示詞快取 |
| Anthropic | claude-sonnet-4-5-20250929 | 200K | $3.00 | $15.00 | 聊天、推理、視覺、函式呼叫、提示詞快取 |
| Bedrock | eu.anthropic.claude-sonnet-4-5-20250929-v1:0 | 200K | $3.00 | $15.00 | 聊天、推理、視覺、函式呼叫、提示詞快取 |
| Azure AI | azure_ai/grok-4 | 131K | $5.50 | $27.50 | 聊天、推理、函式呼叫、網頁搜尋 |
| Azure AI | azure_ai/grok-4-fast-reasoning | 131K | $0.43 | $1.73 | 聊天、推理、函式呼叫、網頁搜尋 |
| Azure AI | azure_ai/grok-4-fast-non-reasoning | 131K | $0.43 | $1.73 | 聊天、函式呼叫、網頁搜尋 |
| Azure AI | azure_ai/grok-code-fast-1 | 131K | $3.50 | $17.50 | 聊天、函式呼叫、網頁搜尋 |
| Groq | groq/moonshotai/kimi-k2-instruct-0905 | 上下文視情況而定 | 定價視情況而定 | 定價視情況而定 | 聊天、函式呼叫 |
| Ollama | Ollama Cloud models | 視情況而定 | 免費 | 免費 | 透過 Ollama Cloud 的自架模型 |
功能
- Anthropic
- Gemini
- 忽略 gemini 工具的 type 參數 - PR #15022
- Vertex AI
- Azure
- Ollama
- 新增 ollama cloud models - PR #15008
- Groq
- 新增 groq/moonshotai/kimi-k2-instruct-0905 - PR #15079
- OpenAI
- 新增對 GPT 5 codex models 的支援 - PR #14841
- DeepInfra
- 使用最新定價更新 DeepInfra 模型資料重新整理 - PR #14939
- Bedrock
- Nvidia NIM
- 新增 Nvidia NIM Rerank 支援 - PR #15152
錯誤修正
新增提供者支援
- AMD Lemonade
- 新增 AMD Lemonade 提供者支援 - PR #14840
LLM API 端點
功能
-
- 為 Responses API 串流請求回傳成本 - PR #15053
-
- 新增對原生 Gemini API 翻譯的完整支援 - PR #15029
-
無縫轉送 Gemini 路由
-
無縫轉送 Vertex AI 路由
-
一般
管理端點 / UI
功能
-
虛擬金鑰
-
模型 + 端點
-
管理員設定
-
MCP
錯誤修正
-
虛擬金鑰
-
模型 + 端點
- 讓 UI theme 設定可公開存取,以便自訂品牌識別 - PR #15074
-
團隊
- 修正 http ui 複製到剪貼簿失敗 - PR #15195
-
記錄
-
測試金鑰
- 在金鑰變更時更新所選模型 - PR #15197
-
儀表板
- 修正儀表板總覽中的 LiteLLM 模型名稱備援 - PR #14998
記錄 / 防護欄 / 提示管理整合
功能
- OpenTelemetry
- 在記錄方法中使用 generation_name 進行 span 命名 - PR #14799
- Langfuse
- Prometheus
- 支援 key/team 上的自訂中繼資料標籤 - PR #15094
防護欄
提示管理
花費追蹤、預算與速率限制
- 成本追蹤
- Proxy:responses API 中的終端使用者成本追蹤 - PR #15124
- 平行請求限制器 v3
- 團隊
- 為 LiteLLM 的團隊新增特定模型的 tpm/rpm 限制 - PR #15044
MCP 閘道
- 伺服器設定
- 錯誤修正
效能 / 負載平衡 / 可靠性改善
- 路由器最佳化
- 快取最佳化
- 工作者管理
- 新增 proxy CLI 選項,可在 N 次請求後回收 workers - PR #15007
- 指標與監控
- LiteLLM Overhead 指標追蹤 - 新增支援在快取命中時追蹤 litellm overhead - PR #15045
文件更新
- 提供者文件
- 一般文件
安全性修正
- JWT Token 安全性 - 不要在 .info() 記錄中記錄 JWT SSO token - PR #15145
新貢獻者
- @herve-ves 做出了他們的首次貢獻,見 PR #14998
- @wenxi-onyx 做出了他們的首次貢獻,見 PR #15008
- @jpetrucciani 做出了他們的首次貢獻,見 PR #15005
- @abhijitjavelin 做出了他們的首次貢獻,見 PR #14983
- @ZeroClover 做出了他們的首次貢獻,見 PR #15039
- @cedarm 做出了他們的首次貢獻,見 PR #15043
- @Isydmr 做出了他們的首次貢獻,見 PR #15025
- @serializer 做出了他們的首次貢獻,見 PR #15013
- @eddierichter-amd 做出了他們的首次貢獻,見 PR #14840
- @malags 做出了他們的首次貢獻,見 PR #15000
- @henryhwang 做出了他們的首次貢獻,見 PR #15029
- @plafleur 做出了他們的首次貢獻,見 PR #15111
- @tyler-liner 做出了他們的首次貢獻,見 PR #14799
- @Amir-R25 做出了他們的首次貢獻,見 PR #15144
- @georg-wolflein 做出了他們的首次貢獻,見 PR #15124
- @niharm 做出了他們的首次貢獻,見 PR #15140
- @anthony-liner 做出了他們的首次貢獻,見 PR #15015
- @rishiganesh2002 做出了他們的首次貢獻,見 PR #15153
- @danielaskdd 做出了他們的首次貢獻,見 PR #15160
- @JVenberg 做出了他們的首次貢獻,見 PR #15146
- @speglich 做出了他們的首次貢獻,見 PR #15072
- @daily-kim 做出了他們的首次貢獻,見 PR #14764