跳至主要內容

v1.81.9 - 控制哪些 MCP 伺服器會公開到網際網路

穩定版發行分支

對於每個穩定版發行,我們現在會維護一個專用分支,版本格式為 litellm_stable_release_branch_x_xx_xx

這樣可以更容易在 day 0 模型發布時進行修補。

v1.81.9 的分支: litellm_stable_release_branch_1_81_9

部署此版本

docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
ghcr.io/berriai/litellm:main-v1.81.9-stable

主要亮點


針對回呼密集型部署,請求處理速度提升 30%

如果您使用像 Langfuse、Datadog 或 Prometheus 這類的記錄回呼,每個請求原本都會承擔不必要的成本:三個迴圈會在每次請求時重新排序您的回呼,即使回呼清單根本沒有變更。您設定的回呼越多,浪費的時間就越多。我們已將這項工作從每次請求改為在啟動時只執行一次。對於使用預設回呼集合的部署,這可讓請求設定速度提升約 30%。對於設定了許多回呼的部署,改善幅度甚至更大。


LiteLLM 觀測台

LiteLLM Observatory 是我們建立的一套長時間執行的版本驗證系統,用來在回歸問題到達使用者之前將其攔截。這套系統設計為可擴充——您可以新增測試、設定模型與失敗門檻,並針對任何部署排入執行佇列。我們的目標是透過這些測試達成 LiteLLM 功能 100% 的覆蓋率。我們會在每次發行前,針對正式環境部署執行 24 小時負載測試,找出像資源生命週期錯誤、OOM,以及只有在持續負載下才會出現的 CPU 回歸等問題。


公開網際網路上的 MCP 伺服器

這次發行透過加入公用/私用可見性與基於 IP 的存取控制,讓您能安全地將 MCP 伺服器公開到公用網際網路。您現在可以執行面向網際網路的 MCP 服務,同時限制可信任網路的存取,並將內部工具保留為私有。

開始使用

UI 團隊軟預算警示

為任何團隊設定軟預算,當支出超過門檻時即可接收電子郵件警示——且不會封鎖任何請求。可直接從 Admin UI 設定門檻與警示電子郵件,無需重新啟動 proxy。

開始使用

讓我們深入了解。


新模型 / 更新模型

新模型支援(13 個新模型)

提供者模型上下文視窗輸入($/100 萬 tokens)輸出($/100 萬 tokens)
Anthropicclaude-opus-4-6100 萬$5.00$25.00
AWS Bedrockanthropic.claude-opus-4-6-v1100 萬$5.00$25.00
Azure AIazure_ai/claude-opus-4-620 萬$5.00$25.00
Vertex AIvertex_ai/claude-opus-4-6100 萬$5.00$25.00
Google Geminigemini/deep-research-pro-preview-12-202565K$2.00$12.00
Vertex AIvertex_ai/deep-research-pro-preview-12-202565K$2.00$12.00
Moonshotmoonshot/kimi-k2.5262K$0.60$3.00
OpenRouteropenrouter/qwen/qwen3-235b-a22b-2507262K$0.07$0.10
OpenRouteropenrouter/qwen/qwen3-235b-a22b-thinking-2507262K$0.11$0.60
Together AItogether_ai/zai-org/GLM-4.720 萬$0.45$2.00
Together AItogether_ai/moonshotai/Kimi-K2.525.6 萬$0.50$2.80
ElevenLabselevenlabs/eleven_v3-$0.18/1K 字元-
ElevenLabselevenlabs/eleven_multilingual_v2-$0.18/1K 字元-

功能

錯誤修正


LLM API 端點

功能

  • Messages API

    • 過濾非 Anthropic 提供者不支援的 Claude Code beta 標頭 - PR #20578
    • 修正使用非 Anthropic 提供者時 anthropic.messages.acreate() 的回應格式不一致 - PR #20442
    • 修正 /api/event_logging/batch 端點上的 404,該問題導致 Claude Code「找不到路由」錯誤 - PR #20504
  • A2A Agent Gateway

    • 允許透過 LiteLLM /chat/completions API 呼叫 A2A 代理程式 - PR #20358
    • 搭配 /chat/completions 使用 A2A 註冊的代理程式 - PR #20362
    • 修正以 localhost/內部 URL 部署的 A2A 代理程式在其 agent card 中的問題 - PR #20604
  • Files API

    • 新增透過 file_id 進行刪除與 GET 的 Gemini 支援 - PR #20329
  • 一般

    • 新增 User-Agent 自訂支援 - PR #19881
    • 修正使用每請求路由時找不到搜尋工具 - PR #19818
    • 在 chat 中轉送額外標頭 - PR #20386

管理端點 / UI

功能

  • SSO 設定

    • SSO 設定團隊對應 - PR #20111
    • UI - SSO:新增團隊對應 - PR #20299
    • 從 JWT access token 擷取使用者角色,以相容 Keycloak - PR #20591
  • 驗證 / SDK

    • 新增 proxy_auth,用於 SDK 中的 OAuth2/JWT token 自動管理 - PR #20238
  • 虛擬金鑰

    • Key reset_spend 端點 - PR #20305
    • UI - Keys:Key 資訊與編輯頁面的允許路由 - PR #20369
    • 新增 Key 資訊端點物件權限資料 - PR #20407
    • Keys 與 Teams 路由設定 + 允許覆寫路由設定 - PR #20205
  • 團隊與預算

    • soft_budget 新增至 Team Table + 建立/更新端點 - PR #20530
    • 團隊軟預算電子郵件警示 - PR #20553
    • UI - Team Settings:軟預算 + 警示電子郵件 - PR #20634
    • UI - User Budget 頁面:無限預算核取方塊 - PR #20380
    • /user/update 允許 max_budget 重設 - PR #20375
  • UI 改進

    • 預設 Team Settings:遷移為使用可重複使用的 Model Select - PR #20310
    • Navbar:隱藏社群互動按鈕的選項 - PR #20308
    • 在 Models 健康頁面顯示團隊別名 - PR #20359
    • Admin Settings:為公開 AI Hub 新增驗證選項 - PR #20444
    • 依使用者時區調整每日支出日期篩選 - PR #20472
  • SCIM

    • 新增 SCIM 資源探索的 base /scim/v2 端點 - PR #20301
  • Proxy CLI

錯誤

  • 修正:移除 UI 登入時不必要的 key 封鎖,該問題曾阻止存取 - PR #20210
  • UI - Team Settings:停用全域防護欄持續性 - PR #20307
  • UI - Model Info 頁面:修正輸入與輸出標籤 - PR #20462
  • UI - Model 頁面:較小螢幕上的欄寬調整 - PR #20599
  • 修正 /key/list user_id 空字串邊界情況 - PR #20623
  • 新增模型、代理程式與 MCP hub 資料的陣列型別檢查,以防止 UI 當機 - PR #20469
  • 修正每日表格上的唯一約束 + 更新失敗時的記錄 - PR #20394

記錄 / 防護欄 / Prompt Management 整合

錯誤修正(3 項修正)

防護欄(7 項更新)

  • 自訂程式碼防護欄

    • 為自訂程式碼防護欄新增 HTTP 支援 + MCP 的統一防護欄 + 代理程式防護欄支援 - PR #20619
    • 自訂程式碼防護欄 UI Playground - PR #20377
  • 團隊自帶防護欄

    • 實作以團隊為基礎的隔離防護欄管理 - PR #20318
  • OpenAI Moderations

    • 確保 OpenAI Moderations Guard 可與 OpenAI Embeddings 一起運作 - PR #20523
  • GraySwan / Cygnal

    • 修正 GraySwan 的 fail-open,並將 metadata 傳遞給 Cygnal API 端點 - PR #19837
  • 一般

    • 在防護欄輸入前檢查 model_response_choices - PR #19784
    • 保留防護欄取樣區塊中的串流內容 - PR #20027

支出追蹤、預算與速率限制

  • 支援 0 成本模型 - 允許內部/免費方案模型項目為零成本 - PR #20249

MCP Gateway(9 項更新)

  • MCP 語意篩選 - 使用語意相似度篩選 MCP 工具,以減少 LLM 請求的工具膨脹 - PR #20296, PR #20316
  • UI - MCP 語意篩選 - 新增 UI 上 MCP 語意篩選設定支援 - PR #20454
  • MCP 基於 IP 的存取控制 - 以 IP 為基礎的限制,將 MCP 伺服器設為可在網際網路上使用的私有/公開 - PR #20607, PR #20620
  • 修正 MCP「Session not found」錯誤,於 VSCode 重新連線時發生 - PR #20298
  • 修正 OAuth2 'Capabilities: none' 錯誤,適用於上游 MCP 伺服器 - PR #20602
  • 將設定中定義的搜尋工具納入 /search_tools/list - PR #20371
  • UI - 搜尋工具:顯示設定中定義的搜尋工具 - PR #20436
  • 確保使用 JWT Auth 時 MCP 權限會被強制執行 - PR #20383
  • 修正 gcs_bucket_name 未被正確傳遞,適用於 MCP 伺服器儲存設定 - PR #20491

效能 / 負載平衡 / 可靠性改進(14 項改進)

  • Prometheus 約降低 40% CPU - 平行化 budget metrics、修正快取錯誤、降低 CPU 使用量 - PR #20544
  • 透過還原 httpx client 快取來防止已關閉 client 錯誤 - PR #20025
  • 在未設定任何 models 或 search tools 時避免不必要的 Router 建立 - PR #20661
  • 使用 CallTypes 快取並減少查詢來最佳化 wrapper_async - PR #20204
  • 在模組層級快取 _get_relevant_args_to_use_for_logging() - PR #20077
  • normalize_request_route 的 LRU 快取 - PR #19812
  • 使用集合交集最佳化 get_standard_logging_metadata - PR #19685
  • completion_cost 中針對未使用功能的提早退出防護 - PR #20020
  • 使用稀疏 kwargs 擷取來最佳化 get_litellm_params - PR #19884
  • 保護 debug log f-strings 並移除多餘的 dict 複製 - PR #19961
  • 以 frozenset 查找取代 enum 建構 - PR #20302
  • 保護 update_environment_variables 中的 debug f-string - PR #20360
  • 當 budget 查詢失敗時發出警告,以顯示無聲的快取遺漏 - PR #20545
  • 為每個 request 新增 INFO 等級的 session 重用記錄,以提升可觀測性 - PR #20597

資料庫變更

結構描述更新

資料表變更類型說明PR移轉
LiteLLM_TeamTable新增欄位新增 allow_team_guardrail_config 布林欄位,用於 team-based guardrail 隔離PR #20318Migration
LiteLLM_DeletedTeamTable新增欄位新增 allow_team_guardrail_config 布林欄位PR #20318Migration
LiteLLM_TeamTable新增欄位新增 soft_budget(double precision),用於 soft budget alertingPR #20530Migration
LiteLLM_DeletedTeamTable新增欄位新增 soft_budget(double precision)PR #20653Migration
LiteLLM_MCPServerTable新增欄位新增 available_on_public_internet 布林欄位,用於 MCP 以 IP 為基礎的存取控制PR #20607Migration

文件更新(14 項更新)

  • 新增設定與驗證 LITELLM_LICENSE 的 FAQ - PR #20284
  • 模型請求標籤文件 - PR #20290
  • 新增 Prisma migration 疑難排解指南 - PR #20300
  • MCP Semantic Filtering 文件 - PR #20316
  • 將 CopilotKit SDK 文件新增為支援的 agents SDK - PR #20396
  • 新增 Nova Sonic 文件 - PR #20320
  • 更新 Vertex AI Text to Speech 文件,顯示音訊的使用方式 - PR #20255
  • 透過逐步說明改善 Okta SSO 設定指南 - PR #20353
  • Langfuse 文件更新 - PR #20443
  • 公開網際網路上的 MCP 暴露文件 - PR #20626
  • 新增部落格文章:Achieving Sub-Millisecond Proxy Overhead - PR #20309
  • 新增關於 litellm-observatory 的部落格文章 - PR #20622
  • 使用 adaptive thinking 更新 Opus 4.6 部落格 - PR #20637
  • gpt-5-search-api 文件釐清 - PR #20512

新貢獻者


完整變更紀錄

v1.81.6-nightly...v1.81.9