跳至主要內容

v1.72.6-stable - MCP 閘道權限管理

部署此版本

docker run litellm
docker run
-e STORE_MODEL_IN_DB=True
-p 4000:4000
docker.litellm.ai/berriai/litellm:main-v1.72.6-stable

重點摘要

  • 為什麼要升級
    • Claude Code 上的 Codex-mini:您現在可以透過 Claude Code 使用 codex-mini(OpenAI 的程式碼助理模型)。
    • MCP 權限管理:在 LiteLLM 上依 Keys、Teams、Organizations(entities)管理 MCP Servers 的權限。
    • UI:可在 logs view 上開啟/關閉自動重新整理。
    • Rate Limiting:支援僅針對 output token 的 rate limiting。
  • 誰應該閱讀
    • 使用 /v1/messages API(Claude Code)的團隊
    • 使用 MCP 的團隊
    • 提供自架模型存取並設定 rate limits 的團隊
  • 升級風險
      • 現有功能或套件更新沒有重大變更。

主要亮點

MCP 權限管理

本次釋出新增支援在 LiteLLM 上依 Keys、Teams、Organizations(entities)管理 MCP Servers 的權限。當 MCP client 嘗試列出 tools 時,LiteLLM 只會回傳該 entity 有權存取的 tools。

這對於需要存取受限制資料(例如 Jira MCP)、但不希望所有人都能使用的情境非常有幫助。

對 Proxy Admins 而言,這可讓所有 MCP Servers 的存取控制集中管理。對開發者而言,這表示您只會看到指派給您的 MCP tools。

Claude Code 上的 Codex-mini

本次釋出新增支援透過 Claude Code 呼叫 codex-mini(OpenAI 的程式碼助理模型)。

這是透過 LiteLLM 啟用任何 Responses API model(包括 o3-pro)可經由 /chat/completions/v1/messages endpoints 呼叫而達成。這包括:

  • 串流請求
  • 非串流請求
  • Responses API models 在成功與失敗時的成本追蹤

以下是今天的使用方式 today


新增 / 更新的模型

價格 / Context Window 更新

提供者模型上下文視窗輸入($/1M tokens)輸出($/1M tokens)類型
VertexAIvertex_ai/claude-opus-4200K$15.00$75.00新增
OpenAIgpt-4o-audio-preview-2025-06-03128k$2.5 (text), $40 (audio)$10 (text), $80 (audio)新增
OpenAIo3-pro200k2080新增
OpenAIo3-pro-2025-06-10200k2080新增
OpenAIo3200k28已更新
OpenAIo3-2025-04-16200k28已更新
Azureazure/gpt-4o-mini-transcribe16k1.25 (text), 3 (audio)5 (text)新增
Mistralmistral/magistral-medium-latest40k25新增
Mistralmistral/magistral-small-latest40k0.51.5新增

已更新模型

錯誤修正

  • Watsonx
    • 忽略 Watsonx deployments 上的 space id(會拋出 json errors)- PR
  • Ollama
    • 為串流請求設定 tool call id - PR
  • Gemini (VertexAI + Google AI Studio)
    • 修正 tool call indexes - PR
    • 處理 function calls 中 arguments 的空字串 - PR
    • 從 file url’s 推斷時新增 audio/ogg mime type 支援 - PR
  • 自訂 LLM
    • 修正將 api_base、api_key、litellm_params_dict 傳入 custom_llm embedding methods - PR s/o ElefHead
  • Huggingface
    • 在缺少時將 /chat/completions 加入 endpoint url - PR
  • Deepgram
    • 支援 async httpx calls - PR
  • Anthropic
    • 將前綴(如果已設定)附加到 assistant content start - PR

功能

  • VertexAI
    • 支援在 passthrough 上透過 env var 設定的 vertex credentials - PR
    • 支援在 model 只有該區域可用時選擇 ‘global’ region - PR
    • Anthropic passthrough 成本計算 + token 追蹤 - PR
    • 支援 passthrough 上的 ‘global’ vertex region - PR
  • Anthropic
  • Perplexity
  • Mistral
  • SGLang
    • 對 context window exceeded error 進行對應以便正確處理 - PR
  • Deepgram
    • 支援 provider specific params - PR
  • Azure
    • 回傳內容安全性篩選結果 - PR

LLM API 端點

錯誤修正

  • 聊天完成
    • 串流 - 確保各個 chunks 的 ‘created’ 一致 - PR

功能

  • MCP
    • 新增 MCP 權限管理控制項 - PR, 文件
    • 新增 MCP List + Call Tool 操作的權限管理 - PR, 文件
    • 可串流 HTTP server 支援 - PR, PR, 文件
    • 使用 Experimental dedicated Rest endpoints 進行 list、呼叫 MCP tools - PR
  • 回應 API
    • 新 API Endpoint - 列出輸入項目 - PR
    • OpenAI + Azure OpenAI 的背景模式 - PR
    • responses api 請求上的 Langfuse/other Logging 支援 - PR
  • 聊天完成
    • Responses API 的橋接器 - 可透過 /chat/completions/v1/messages 呼叫 codex-mini - PR, PR

支出追蹤

錯誤修正


管理端點 / UI

錯誤

  • 使用者
    • /user/info - 修正傳入使用者時,在使用者 ID 中包含 + 的情況
    • 新增由管理員啟動的密碼重設流程 - PR
    • 修正預設使用者設定 UI 渲染錯誤 - PR
  • 預算
    • 修正建立新使用者預算時的成功訊息 - PR

功能

  • 左側導覽
    • 在 UI 顯示剩餘的 Enterprise 使用者數
  • MCP
    • 新增伺服器新增表單 - PR
    • 允許編輯 mcp 伺服器 - PR
  • 模型
    • 在 UI 新增 deepgram 模型
    • 在 UI 新增 Model Access Group 支援 - PR
  • 金鑰
    • 修剪過長的使用者 ID - PR
  • 記錄
    • 在記錄檢視新增即時尾隨功能,允許使用者在高流量時停用自動重新整理 - PR
    • 稽核記錄 - 預覽截圖 - PR

記錄 / 防護欄 整合

錯誤

功能

  • Lasso 防護欄
    • [NEW] Lasso Guardrails 支援 - PR
  • 使用者
    • /user/new 上新增 organizations 參數 - 可在建立時將使用者加入組織 - PR
  • 在使用 bridge 邏輯時防止重複記錄 - PR

效能 / 可靠性改善

錯誤

功能

  • 快取
    • 新增可選的 ‘litellm[caching]’ pip install,以加入磁碟快取依賴 - PR

一般 Proxy 改善

錯誤

  • aiohttp
    • 修正 aiohttp transport 的 transfer encoding 錯誤 - PR

功能

  • aiohttp
    • 為 aiohttp transport 啟用系統 Proxy 支援 - PR(s/o idootop
  • CLI
    • 讓所有命令都顯示伺服器 URL - PR
  • Unicorn
    • 允許設定 keep alive timeout - PR
  • Experimental Rate Limiting v2(透過 EXPERIMENTAL_MULTI_INSTANCE_RATE_LIMITING="True" 啟用)
    • 支援僅依 output_tokens 指定 rate limit - PR
    • 呼叫失敗時減少平行請求數 - PR
    • 僅支援 in-memory rate limiting - PR
    • 依 key/user/team 回傳剩餘 rate limits - PR
  • Helm
    • 支援 migrations-job.yaml 中的 extraContainers - PR

新增貢獻者


Demo 實例

以下是用來測試變更的 Demo 實例:

Git Diff