v1.78.0-stable - MCP Gateway: 依團隊、金鑰控制工具存取
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.78.0-stable
pip install litellm
pip install litellm==1.78.0.post1
主要亮點
- MCP Gateway - 依團隊、金鑰控制工具存取 - 依團隊/金鑰控制 MCP 工具存取。
- 效能改善 - p99 延遲降低 70%
- GPT-5 Pro 與 GPT-Image-1-Mini - OpenAI 的 GPT-5 Pro(400K context)與 gpt-image-1-mini 圖像生成的 Day 0 支援
- EnkryptAI Guardrails - 新的內容審核防護欄整合
- 基於標籤的預算 - 支援根據請求標籤設定預算
MCP Gateway - 依團隊、金鑰控制工具存取
Proxy 管理員現在可以依團隊或金鑰控制 MCP 工具存取。這讓您能輕鬆為不同團隊授予同一個 MCP 伺服器中工具的選擇性存取權。
例如,您現在可以讓 Engineering 團隊存取 list_repositories、create_issue 和 search_code 工具,而 Sales 則只可存取 search_code 和 close_issue 工具。
這讓 Proxy 管理員更容易管理 MCP 工具存取。
效能 - p99 延遲降低 70%
此版本將 LiteLLM AI Gateway 的 p99 延遲降低了 70%,使其在低延遲使用情境中表現更佳。
這些提升來自兩項關鍵增強:
可靠的工作階段
新增對 aiohttp 共用工作階段的支援。shared_session 參數現在會在所有請求中一致使用,啟用連線池化。
更快的路由
新的 model_name_to_deployment_indices 雜湊對映取代了 _get_all_deployments() 中的 O(n) 清單掃描,改以 O(1) 雜湊查找,提升路由效能與擴充性。
因此,各延遲百分位的效能都有所提升:
- 中位數延遲: 110 ms → 100 ms(−9.1%)
- p95 延遲: 440 ms → 150 ms(−65.9%)
- p99 延遲: 810 ms → 240 ms(−70.4%)
- 平均延遲: 310 ms → 111.73 ms(−64.0%)
測試設定
Locust
- 並發使用者: 1,000
- 漸進增加: 500
系統規格
- 使用了資料庫
- CPU: 4 vCPUs
- 記憶體: 8 GB RAM
- LiteLLM Workers: 4
- Instances: 4
組態 (config.yaml)
查看完整組態: gist.github.com/AlexsanderHamir/config.yaml
負載腳本 (no_cache_hits.py)
查看完整負載測試腳本: gist.github.com/AlexsanderHamir/no_cache_hits.py
新模型 / 已更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | 輸入 ($/1M tokens) | 輸出 ($/1M tokens) | 功能 |
|---|---|---|---|---|---|
| OpenAI | gpt-5-pro | 400K | $15.00 | $120.00 | Responses API、reasoning、vision、function calling、prompt caching、web search |
| OpenAI | gpt-5-pro-2025-10-06 | 400K | $15.00 | $120.00 | Responses API、reasoning、vision、function calling、prompt caching、web search |
| OpenAI | gpt-image-1-mini | - | $2.00/img | - | 圖像生成與編輯 |
| OpenAI | gpt-realtime-mini | 128K | $0.60 | $2.40 | 即時音訊、function calling |
| Azure AI | azure_ai/Phi-4-mini-reasoning | 131K | $0.08 | $0.32 | 函式呼叫 |
| Azure AI | azure_ai/Phi-4-reasoning | 32K | $0.125 | $0.50 | Function calling、reasoning |
| Azure AI | azure_ai/MAI-DS-R1 | 128K | $1.35 | $5.40 | Reasoning、function calling |
| Bedrock | au.anthropic.claude-sonnet-4-5-20250929-v1:0 | 200K | $3.30 | $16.50 | 聊天、reasoning、vision、function calling、prompt caching |
| Bedrock | global.anthropic.claude-sonnet-4-5-20250929-v1:0 | 200K | $3.00 | $15.00 | 聊天、reasoning、vision、function calling、prompt caching |
| Bedrock | global.anthropic.claude-sonnet-4-20250514-v1:0 | 1M | $3.00 | $15.00 | 聊天、reasoning、vision、function calling、prompt caching |
| Bedrock | cohere.embed-v4:0 | 128K | $0.12 | - | 嵌入、支援圖像輸入 |
| OCI | oci/cohere.command-latest | 128K | $1.56 | $1.56 | 函式呼叫 |
| OCI | oci/cohere.command-a-03-2025 | 256K | $1.56 | $1.56 | 函式呼叫 |
| OCI | oci/cohere.command-plus-latest | 128K | $1.56 | $1.56 | 函式呼叫 |
| Together AI | together_ai/moonshotai/Kimi-K2-Instruct-0905 | 262K | $1.00 | $3.00 | 函式呼叫 |
| Together AI | together_ai/Qwen/Qwen3-Next-80B-A3B-Instruct | 262K | $0.15 | $1.50 | 函式呼叫 |
| Together AI | together_ai/Qwen/Qwen3-Next-80B-A3B-Thinking | 262K | $0.15 | $1.50 | 函式呼叫 |
| Vertex AI | MedGemma models | 視情況而定 | 視情況而定 | 視情況而定 | 於自訂端點上的醫療導向 Gemma 模型 |
| Watson X | 27 new foundation models | 視情況而定 | 視情況而定 | 視情況而定 | Granite、Llama、Mistral 系列 |
功能
-
- 為 Snowflake Cortex REST API 新增 function calling 支援 - PR #15221
-
- 修正 Proxy 模式中 Gemini/Vertex AI 提供者的標頭轉送 - PR #15231
-
- 新增支援工具呼叫與串流能力的 OCI Cohere - PR #15365
-
- 新增 together 模型 - PR #15383
錯誤修正
- 一般
LLM API 端點
功能
-
- Feat(files): 為檔案操作新增 @client 裝飾器 - PR #15339
-
- 透過實際串流回應來修正 gemini cli - PR #15264
-
- Azure - 支援搭配 router 模型的 passthrough - PR #15240
錯誤
- 一般
- 修正快取命中時未回傳 x-litellm-cache-key 標頭的問題 - PR #15348
管理端點 / UI
功能
-
Proxy CLI 驗證
- Proxy CLI - 不要將現有金鑰儲存在 URL 中,改為儲存在 state 參數中 - PR #15290
-
模型 + 端點
-
團隊
-
UI 基礎架構
- 新增 prettier 以自動格式化前端 - PR #15215
- 在 UI 的 npm run dev 指令中加入 turbopack,以便在開發期間更快建置 - PR #15250
- (效能) 修正:以精簡的 key aliases 端點取代臃腫的 key list 呼叫 - PR #15252
- 可能修正了過期 cookie 造成的 UI 異常閃動問題 - PR #15309
- LiteLLM UI 重構基礎架構 - PR #15236
- 強制移除 UI 中未使用的 imports - PR #15416
- 修正:使用量頁面 >> 模型活動 >> 每日花費圖表:在高花費數值時 y 軸裁切 - PR #15389
- 更新 guardrail 提供者標誌 - PR #15421
-
管理設定
-
SSO
- SSO - 支援 EntraID 應用程式角色 - PR #15351
記錄 / 防護欄 / 提示管理整合
功能
防護欄
花費追蹤、預算與速率限制
MCP 閘道
-
工具控制
- MCP Gateway - UI - 為 Key、Teams 選擇允許的工具 - PR #15241
- MCP Gateway - 後端 - 允許依團隊/key 儲存允許的工具 - PR #15243
- MCP Gateway - 細粒度資料庫物件儲存控制 - PR #15255
- MCP Gateway - Litellm mcp 修正團隊控制 - PR #15304
- MCP Gateway - QA/修正 - 確保 Team/Key 層級強制執行可用於 MCP - PR #15305
- 功能:在 /v1/mcp/server/health 端點回應中包含 server_name - PR #15431
-
OpenAPI 整合
-
設定
效能 / 負載平衡 / 可靠性改善
-
路由器最佳化
-
工作階段管理
-
SSL/TLS 效能
- 效能:使用優先 cipher 最佳化 SSL/TLS handshake 效能 - PR #15398
-
相依套件
- 將 tenacity 版本升級至 8.5.0 - PR #15303
-
資料遮罩
- 修正 - SensitiveDataMasker 會將列表轉換為字串 - PR #15420
一般 AI Gateway 改進
安全性
- 一般
- 修正:在啟用 redact_user_api_key_info 時遮蓋 AWS 憑證 - PR #15321
文件更新
-
提供者文件
-
部署
- 刪除會導致基於
config.yaml的啟動失敗的 docker-compose 有問題註解 - PR #15425
- 刪除會導致基於
新貢獻者
- @Gal-bloch 做出了他們的首次貢獻,見 PR #15219
- @lcfyi 做出了他們的首次貢獻,見 PR #15315
- @ashengstd 做出了他們的首次貢獻,見 PR #15362
- @vkolehmainen 做出了他們的首次貢獻,見 PR #15363
- @jlan-nl 做出了他們的首次貢獻,見 PR #15330
- @BCook98 做出了他們的首次貢獻,見 PR #15402
- @PabloGmz96 做出了他們的首次貢獻,見 PR #15425