v1.81.9 - 控制哪些 MCP 伺服器會公開到網際網路
對於每個穩定版發行,我們現在會維護一個專用分支,版本格式為 litellm_stable_release_branch_x_xx_xx。
這樣可以更容易在 day 0 模型發布時進行修補。
v1.81.9 的分支: litellm_stable_release_branch_1_81_9
部署此版本
- Docker
- Pip
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
ghcr.io/berriai/litellm:main-v1.81.9-stable
pip install litellm==1.81.9
主要亮點
- Claude Opus 4.6 - Anthropic、AWS Bedrock、Azure AI 與 Vertex AI 的完整支援,具備自適應思考與 100 萬上下文視窗
- A2A Agent Gateway - 透過標準
/chat/completionsAPI 呼叫已註冊的 A2A(Agent-to-Agent)代理程式 - 將 MCP 伺服器公開到公用網際網路 - 針對面向網際網路的部署,以公用/私用可見性與基於 IP 的存取控制來啟動 MCP 伺服器
- UI 團隊軟預算警示 - 為團隊設定軟預算,當支出超過門檻時接收電子郵件警示——且不會封鎖請求
- 效能最佳化 - 多項效能改進,包括 Prometheus CPU 降低約 40%、LRU 快取,以及最佳化的記錄路徑
- LiteLLM Observatory - 自動化 24 小時負載測試
- 針對回呼密集型部署,請求處理速度提升 30% - [回呼密集型部署的效能改進]PR #20354
針對回呼密集型部署,請求處理速度提升 30%
如果您使用像 Langfuse、Datadog 或 Prometheus 這類的記錄回呼,每個請求原本都會承擔不必要的成本:三個迴圈會在每次請求時重新排序您的回呼,即使回呼清單根本沒有變更。您設定的回呼越多,浪費的時間就越多。我們已將這項工作從每次請求改為在啟動時只執行一次。對於使用預設回呼集合的部署,這可讓請求設定速度提升約 30%。對於設定了許多回呼的部署,改善幅度甚至更大。
LiteLLM 觀測台
LiteLLM Observatory 是我們建立的一套長時間執行的版本驗證系統,用來在回歸問題到達使用者之前將其攔截。這套系統設計為可擴充——您可以新增測試、設定模型與失敗門檻,並針對任何部署排入執行佇列。我們的目標是透過這些測試達成 LiteLLM 功能 100% 的覆蓋率。我們會在每次發行前,針對正式環境部署執行 24 小時負載測試,找出像資源生命週期錯誤、OOM,以及只有在持續負載下才會出現的 CPU 回歸等問題。
公開網際網路上的 MCP 伺服器
這次發行透過加入公用/私用可見性與基於 IP 的存取控制,讓您能安全地將 MCP 伺服器公開到公用網際網路。您現在可以執行面向網際網路的 MCP 服務,同時限制可信任網路的存取,並將內部工具保留為私有。
UI 團隊軟預算警示
為任何團隊設定軟預算,當支出超過門檻時即可接收電子郵件警示——且不會封鎖任何請求。可直接從 Admin UI 設定門檻與警示電子郵件,無需重新啟動 proxy。
讓我們深入了解。
新模型 / 更新模型
新模型支援(13 個新模型)
| 提供者 | 模型 | 上下文視窗 | 輸入($/100 萬 tokens) | 輸出($/100 萬 tokens) |
|---|---|---|---|---|
| Anthropic | claude-opus-4-6 | 100 萬 | $5.00 | $25.00 |
| AWS Bedrock | anthropic.claude-opus-4-6-v1 | 100 萬 | $5.00 | $25.00 |
| Azure AI | azure_ai/claude-opus-4-6 | 20 萬 | $5.00 | $25.00 |
| Vertex AI | vertex_ai/claude-opus-4-6 | 100 萬 | $5.00 | $25.00 |
| Google Gemini | gemini/deep-research-pro-preview-12-2025 | 65K | $2.00 | $12.00 |
| Vertex AI | vertex_ai/deep-research-pro-preview-12-2025 | 65K | $2.00 | $12.00 |
| Moonshot | moonshot/kimi-k2.5 | 262K | $0.60 | $3.00 |
| OpenRouter | openrouter/qwen/qwen3-235b-a22b-2507 | 262K | $0.07 | $0.10 |
| OpenRouter | openrouter/qwen/qwen3-235b-a22b-thinking-2507 | 262K | $0.11 | $0.60 |
| Together AI | together_ai/zai-org/GLM-4.7 | 20 萬 | $0.45 | $2.00 |
| Together AI | together_ai/moonshotai/Kimi-K2.5 | 25.6 萬 | $0.50 | $2.80 |
| ElevenLabs | elevenlabs/eleven_v3 | - | $0.18/1K 字元 | - |
| ElevenLabs | elevenlabs/eleven_multilingual_v2 | - | $0.18/1K 字元 | - |
功能
-
- 支援 Cohere embed v4 的
dimensions參數 - PR #20235
- 支援 Cohere embed v4 的
-
- 為 GPT OSS Cerebras 新增 reasoning 參數支援 - PR #20258
-
- 新增 Kimi K2.5 模型條目 - PR #20273
-
- 新增 Qwen3-235B 模型 - PR #20455
-
- 新增 GLM-4.7 與 Kimi-K2.5 模型 - PR #20319
-
- 新增
eleven_v3與eleven_multilingual_v2TTS 模型 - PR #20522
- 新增
-
- 為模型新增缺少的 capability 標記 - PR #20276
-
- 修正 system prompts 被丟棄的問題,並自動新增必要的 Copilot 標頭 - PR #20113
-
- 修正 GigaChat 提供者連續 user 訊息錯誤合併的問題 - PR #20341
-
- 新增 xAI
/realtimeAPI 支援 - 可與 LiveKit SDK 搭配使用 - PR #20381
- 新增 xAI
-
- 新增
gpt-5-search-api模型與文件說明澄清 - PR #20512
- 新增
錯誤修正
-
- 修正
provider_specific_fields的額外輸入不被允許錯誤 - PR #20334
- 修正
-
- 修正:Managed Batches 在列出與取消批次時的狀態管理不一致 - PR #20331
-
- 修正
open_ai_embedding_models使其custom_llm_provider為 None - PR #20253
- 修正
LLM API 端點
功能
-
- 新增透過 file_id 進行刪除與 GET 的 Gemini 支援 - PR #20329
-
一般
管理端點 / UI
功能
-
SSO 設定
-
驗證 / SDK
- 新增
proxy_auth,用於 SDK 中的 OAuth2/JWT token 自動管理 - PR #20238
- 新增
-
虛擬金鑰
-
團隊與預算
-
UI 改進
-
SCIM
- 新增 SCIM 資源探索的 base
/scim/v2端點 - PR #20301
- 新增 SCIM 資源探索的 base
-
Proxy CLI
- RDS IAM 驗證的 CLI 參數 - PR #20437
錯誤
- 修正:移除 UI 登入時不必要的 key 封鎖,該問題曾阻止存取 - PR #20210
- UI - Team Settings:停用全域防護欄持續性 - PR #20307
- UI - Model Info 頁面:修正輸入與輸出標籤 - PR #20462
- UI - Model 頁面:較小螢幕上的欄寬調整 - PR #20599
- 修正
/key/listuser_id空字串邊界情況 - PR #20623 - 新增模型、代理程式與 MCP hub 資料的陣列型別檢查,以防止 UI 當機 - PR #20469
- 修正每日表格上的唯一約束 + 更新失敗時的記錄 - PR #20394
記錄 / 防護欄 / Prompt Management 整合
錯誤修正(3 項修正)
-
- 修正當 spans 包含 null 屬性時,Langfuse OTEL trace 匯出失敗 - PR #20382
-
- 修正不正確的失敗指標標籤,導致錯誤率計數失準 - PR #20152
-
- 修正某些預算門檻設定下 Slack 警示傳送失敗 - PR #20257
防護欄(7 項更新)
-
自訂程式碼防護欄
-
團隊自帶防護欄
- 實作以團隊為基礎的隔離防護欄管理 - PR #20318
-
- 確保 OpenAI Moderations Guard 可與 OpenAI Embeddings 一起運作 - PR #20523
-
- 修正 GraySwan 的 fail-open,並將 metadata 傳遞給 Cygnal API 端點 - PR #19837
-
一般
支出追蹤、預算與速率限制
- 支援 0 成本模型 - 允許內部/免費方案模型項目為零成本 - PR #20249
MCP Gateway(9 項更新)
- MCP 語意篩選 - 使用語意相似度篩選 MCP 工具,以減少 LLM 請求的工具膨脹 - PR #20296, PR #20316
- UI - MCP 語意篩選 - 新增 UI 上 MCP 語意篩選設定支援 - PR #20454
- MCP 基於 IP 的存取控制 - 以 IP 為基礎的限制,將 MCP 伺服器設為可在網際網路上使用的私有/公開 - PR #20607, PR #20620
- 修正 MCP「Session not found」錯誤,於 VSCode 重新連線時發生 - PR #20298
- 修正 OAuth2 'Capabilities: none' 錯誤,適用於上游 MCP 伺服器 - PR #20602
- 將設定中定義的搜尋工具納入
/search_tools/list- PR #20371 - UI - 搜尋工具:顯示設定中定義的搜尋工具 - PR #20436
- 確保使用 JWT Auth 時 MCP 權限會被強制執行 - PR #20383
- 修正
gcs_bucket_name未被正確傳遞,適用於 MCP 伺服器儲存設定 - PR #20491
效能 / 負載平衡 / 可靠性改進(14 項改進)
- Prometheus 約降低 40% CPU - 平行化 budget metrics、修正快取錯誤、降低 CPU 使用量 - PR #20544
- 透過還原 httpx client 快取來防止已關閉 client 錯誤 - PR #20025
- 在未設定任何 models 或 search tools 時避免不必要的 Router 建立 - PR #20661
- 使用
CallTypes快取並減少查詢來最佳化wrapper_async- PR #20204 - 在模組層級快取
_get_relevant_args_to_use_for_logging()- PR #20077 normalize_request_route的 LRU 快取 - PR #19812- 使用集合交集最佳化
get_standard_logging_metadata- PR #19685 completion_cost中針對未使用功能的提早退出防護 - PR #20020- 使用稀疏 kwargs 擷取來最佳化
get_litellm_params- PR #19884 - 保護 debug log f-strings 並移除多餘的 dict 複製 - PR #19961
- 以 frozenset 查找取代 enum 建構 - PR #20302
- 保護
update_environment_variables中的 debug f-string - PR #20360 - 當 budget 查詢失敗時發出警告,以顯示無聲的快取遺漏 - PR #20545
- 為每個 request 新增 INFO 等級的 session 重用記錄,以提升可觀測性 - PR #20597
資料庫變更
結構描述更新
| 資料表 | 變更類型 | 說明 | PR | 移轉 |
|---|---|---|---|---|
LiteLLM_TeamTable | 新增欄位 | 新增 allow_team_guardrail_config 布林欄位,用於 team-based guardrail 隔離 | PR #20318 | Migration |
LiteLLM_DeletedTeamTable | 新增欄位 | 新增 allow_team_guardrail_config 布林欄位 | PR #20318 | Migration |
LiteLLM_TeamTable | 新增欄位 | 新增 soft_budget(double precision),用於 soft budget alerting | PR #20530 | Migration |
LiteLLM_DeletedTeamTable | 新增欄位 | 新增 soft_budget(double precision) | PR #20653 | Migration |
LiteLLM_MCPServerTable | 新增欄位 | 新增 available_on_public_internet 布林欄位,用於 MCP 以 IP 為基礎的存取控制 | PR #20607 | Migration |
文件更新(14 項更新)
- 新增設定與驗證 LITELLM_LICENSE 的 FAQ - PR #20284
- 模型請求標籤文件 - PR #20290
- 新增 Prisma migration 疑難排解指南 - PR #20300
- MCP Semantic Filtering 文件 - PR #20316
- 將 CopilotKit SDK 文件新增為支援的 agents SDK - PR #20396
- 新增 Nova Sonic 文件 - PR #20320
- 更新 Vertex AI Text to Speech 文件,顯示音訊的使用方式 - PR #20255
- 透過逐步說明改善 Okta SSO 設定指南 - PR #20353
- Langfuse 文件更新 - PR #20443
- 公開網際網路上的 MCP 暴露文件 - PR #20626
- 新增部落格文章:Achieving Sub-Millisecond Proxy Overhead - PR #20309
- 新增關於 litellm-observatory 的部落格文章 - PR #20622
- 使用 adaptive thinking 更新 Opus 4.6 部落格 - PR #20637
gpt-5-search-api文件釐清 - PR #20512
新貢獻者
- @Quentin-M 在 PR #19818 中首次貢獻
- @amirzaushnizer 在 PR #20235 中首次貢獻
- @cscguochang 在 PR #20214 中首次貢獻
- @krauckbot 在 PR #20273 中首次貢獻
- @agrattan0820 在 PR #19784 中首次貢獻
- @nina-hu 在 PR #20472 中首次貢獻
- @swayambhu94 在 PR #20469 中首次貢獻
- @ssadedin 在 PR #20566 中首次貢獻