v1.92.0 - Claude Sonnet 5、正式版 MCP OAuth 與新提供者
部署此版本
- Docker
- Pip
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:1.92.0
pip install litellm==1.92.0
主要亮點
- Claude Sonnet 5 - 跨 Anthropic、Amazon Bedrock(包括區域推論設定檔)、Vertex AI 與 Azure AI 的一級支援,具備 1M token 上下文視窗、推理、電腦使用、PDF 輸入,以及截至 2026-08-31 的入門定價。
- 可直接用於正式環境的 MCP OAuth(On-Behalf-Of) - token_exchange 分支移至 v2 resolver,採用 RFC 9728 -> RFC 8414 端點探索(不猜測 IdP)、持久化的 Dynamic Client Registration、每個伺服器的對外併發限制,以及適用於大型工具目錄的
mcp_tool_search虛擬工具。 - 兩個新提供者 - Tencent(透過 TokenHub 提供 DeepSeek V4 flash/pro,支援聊天與
/v1/messages)以及 Google Distributed Cloud(GDC)Gemini,適用於內部部署/主權部署。 - 存取控制強化 - 對
permissions與allowed_routes在 key、user 與 team 端點上的 admin-gating、具版本化重新加密遷移的 AES-256-GCM 靜態憑證加密,以及從啟動與 router 錯誤記錄中去除 secrets。 - 更快的熱路徑 - spend-counter 增量與請求前的 budget 讀取現在會同時收集,cost-callback deepcopy 已移出請求事件迴圈,OTel runtime imports 會被記憶化,而 Redis-叢集重新連線與 read-replica 啟動韌性可在基礎設施短暫異常時維持 proxy 服務。
新提供者與端點
新提供者(2 個新提供者)
| 提供者 | 支援的 LiteLLM 端點 | 說明 |
|---|---|---|
Tencent (tencent) | Chat Completions、/v1/messages | Tencent TokenHub 提供者,提供支援推理、prompt 快取與 Anthropic Messages 支援的 DeepSeek V4(flash 與 pro)- PR #31903 |
Google Distributed Cloud - GDC (gdc) | 聊天補全 | 適用於內部部署與主權雲端部署的 Google Distributed Cloud Gemini 提供者 - PR #31895 |
新模型/更新模型
新增模型支援(4 個模型共有 13 筆新定價項目)
| 提供者 | 模型 | 上下文視窗 | 輸入(每 100 萬 token) | 輸出(每 100 萬 token) | 功能 |
|---|---|---|---|---|---|
| Anthropic / Bedrock / Vertex / Azure AI | claude-sonnet-5 | 1M | $2.00 | $10.00 | 推理、視覺、函式呼叫、prompt 快取、電腦使用、PDF 輸入、自適應思考 |
| Bedrock Mantle | bedrock_mantle/xai.grok-4.3 | 131K | $1.25 | $2.50 | 推理、視覺、函式呼叫 |
| Tencent | tencent/deepseek-v4-flash | 1M | $0.14 | $0.28 | 推理、函式呼叫、prompt 快取 |
| Tencent | tencent/deepseek-v4-pro | 1M | $0.435 | $0.87 | 推理、函式呼叫、prompt 快取 |
Claude Sonnet 5 隨附 Anthropic(claude-sonnet-5)、Amazon Bedrock(anthropic.claude-sonnet-5 以及 us / eu / au / jp / global 區域推論設定檔)、Vertex AI(vertex_ai/claude-sonnet-5)與 Azure AI(azure_ai/claude-sonnet-5)的定價項目 - PR #31740,並已套用入門定價至 2026-08-31 - PR #31917。
功能
- Anthropic
- Amazon Bedrock
- Google Vertex AI
- Google Gemini
- Tencent
- 新增 Tencent TokenHub 作為提供 DeepSeek V4 的提供者 - PR #31903
- Fireworks AI
- 在模型成本對照表中啟用
glm-5p1的工具呼叫 - PR #29697
- 在模型成本對照表中啟用
- Databricks
- 拆分平行工具呼叫,讓每則工具訊息都接在其
tool_calls之後 - PR #31633
- 拆分平行工具呼叫,讓每則工具訊息都接在其
- 一般
- 新增 Parasail 作為以 JSON 設定的 OpenAI 相容提供者 - PR #29842
錯誤修正
LLM API 端點
功能
- Responses API
- /v1/messages
- 移除
/v1/messages上的頂層additional_drop_params- PR #31645
- 移除
- Image Generation
- 支援 Azure AI MAI-Image-2.5 影像生成 - PR #29688
- A2A
- 支援
a2a-sdk1.x 代理路由,適用於 0.3 和 1.0 代理程式 - PR #30950
- 支援
- Sandbox
- 當設定
metadata.session_id時,在請求之間重用 e2b container - PR #31688
- 當設定
- 一般
錯誤
- Responses API
- 在 Responses-to-Chat 轉換中保留強制 function
tool_choice名稱 - PR #29812 - 在 Responses bridge 中將僅含 system 的 chat request 對應到 system input 項目 - PR #29817
- 在
/v1/responses路由上將metadata.tags合併至litellm_metadata- PR #31793 - 依據模型資訊,將 GitHub Copilot
/v1/responses以每個模型進行路由 - PR #29747 - 移除無法對應的 Bedrock Responses tools,而不是讓請求失敗 - PR #31663
- 在 Responses-to-Chat 轉換中保留強制 function
- Realtime API
- OCR
- 在 Azure AI doc-intelligence
/v1/ocr中保留內容、表格與keyValuePairs- PR #32018
- 在 Azure AI doc-intelligence
- A2A
- 在 A2A chat 轉換中填入回應使用量 - PR #31980
- 一般
管理端點 / UI
功能
- 虛擬金鑰與存取控制
- 將
permissions、/key/update、/key/regenerate、/user/new、/user/update以及批次金鑰更新設為僅管理員可用 - PR #31810, PR #31998, PR #32002 - 將
allowed_routes是否存在於/key/update與/key/regenerate設為僅管理員可用 - PR #31987 - 為非管理員限制
/key/generatebudget_limits與權限 - PR #31469 - 拒絕非管理員在個人金鑰上使用團隊範圍的
object_permission- PR #31471 - 支援
object_permission於default_key_generate_params中 - PR #31776 - 拒絕非有限的
budget_limits視窗,並在/key/generate上強制拒絕 CLI session-token 個人金鑰預算 - PR #31630, PR #31631 - 收緊
/get/config/callbacks回應上的角色限制,並擴充 banned-params + admin-clear 清單 - PR #31745, PR #31742 - 稽核 default-user-settings 與其餘 system-wide-settings 更新 - PR #31753, PR #31754
- JWT auth 在無法解析的 claim 上改為選用回退至 DB team - PR #28913
- 在建立 policy attachment 時,拒絕不存在的 team/key/model scope 項目 - PR #32131
- 將
- UI
- shadcn migration 基礎:Tailwind v4、shadcn init 與 antd cascade 修正 - PR #31995
- 將 chat UI 從 antd 遷移至 shadcn/ui,並新增金鑰管理與使用量面板 - PR #32074
- 在專用 modal 中輪替模型憑證,避免一般儲存覆寫 secrets - PR #28089
- 說明 Update API Key modal 僅會輪替
api_key- PR #31805 - 在 edit-team-member 表單中新增預算持續時間 - PR #29717
- 在公開 model hub 上顯示提供者圖示 - PR #29958
錯誤
- 虛擬金鑰與模型
- 在建立金鑰時向內部使用者顯示團隊專案 - PR #28855
- 在金鑰編輯頁面將預設金鑰類型標示為「Full Access」 - PR #29870
- 在刪除與重新整理之間保留 virtual-keys 篩選條件 - PR #31533
- 允許在團隊被刪除後刪除 BYOK model,並在刪除團隊時刪除其 BYOK models - PR #29875, PR #29977
- 在 token counter 中僅計算舊版
function_call.arguments- PR #31741 - 修正拼字錯誤
generic_role_mappoings->generic_role_mappings- PR #29753
- UI
AI 整合
記錄
- Prometheus
- OpenTelemetry
- S3
- 在 PUT 時送出
Content-MD5,並在 s3 v2 記錄器中支援可選的伺服器端加密 - PR #31928
- 在 PUT 時送出
- Microsoft Sentinel
- 從
AZURE_SENTINEL_AUDIT_STREAM_NAME解析稽核串流 - PR #32010
- 從
- FOCUS Export
- 一般
防護欄
- Model Armor
- 使用 Model Armor 掃描檔案與文件附件 - PR #31655
- CrowdStrike AIDR
- Headroom
- 一般
秘密管理員
- 一般
- 具版本化格式與重新加密遷移的 AES-256-GCM 靜態憑證加密 - PR #31215
支出追蹤、預算與速率限制
- 預算與備援
- 成本追蹤
- 以
category、rate_limit_type、model與llm_provider欄位標準化 rate-limit 錯誤 - PR #27687 - 儲存
/v1/realtime會話的成本明細 - PR #30069 - 追蹤未受管理 Vertex AI 批次工作成本 - PR #31442
- 回報被封鎖回應上的實際 token 用量 - PR #31217
- 在
/messages與/generateContent上發出x-litellm-response-cost標頭 - PR #31675 - 在傳遞式成本追蹤中將
*.cognitiveservices.azure.com辨識為 OpenAI 相容 - PR #29730 - 在 A2A 原生送出路徑上記錄代理程式
cost_per_query與輸入 token - PR #31979 - 只將活躍使用者計入授權席次上限 - PR #31227
- 記錄每種 token 類型的推理與快取成本明細 - PR #31623
- 以
MCP 閘道
- OAuth 2.0(On-Behalf-Of)v2
- 將 token_exchange (OBO) 分支移轉到 v2 resolver,並透過 discovery threading、稽核強化與 RFC 9728 challenge 使其可投入正式環境 - PR #31526, PR #31622
- 透過 RFC 9728 -> RFC 8414 探索 OBO token endpoint,而不是猜測 IdP - PR #31762
- 保留 DCR
client_id,讓互動式 OAuth token 更新可運作,包括 on-create Authorize & Fetch - PR #31912, PR #31920 - 在 token endpoint 權威性地解析每位使用者的 OAuth 身分 - PR #31657
- 支援上游 OAuth token endpoint 的
client_secret_basic,並在 UI 中新增 token-endpoint auth-method 選擇器 - PR #31635, PR #31739 - 依據
auth_type=oauth2限制 OAuth authorize/token/register/discovery - PR #31736 - 鏡像上游 token 存續時間,而不是強制 1 小時 OBO 到期 - PR #29951
- 在 create-server 視窗關閉時重設 OAuth 狀態,讓先前伺服器的 token 不再洩漏到下一次 add-server 工作階段 - PR #30000
- 允許非建立者使用者以 OAuth 登入 OBO 模式伺服器,並在 authorize/token 檢查中允許 team access-group 授權 - PR #29867, PR #30041
- 伺服器管理與工具
- 為大型工具目錄新增
mcp_tool_search虛擬工具 - PR #31777 - 限制每個 MCP server 的對外工具呼叫並行數 - PR #31641
- 新增
all-proxy-mcpserverssentinel,以授權團隊擁有每個 MCP server - PR #32012 - 將 MCP 工具支出彙總到使用者計數器與使用量 UI - PR #31576
- 在
store_model_in_db為 false 時,於啟動時從 DB 載入 MCP server registry - PR #31775 - 在 otel_v2 下為 MCP discovery 發出
tools/listCLIENT span - PR #31525
- 為大型工具目錄新增
- 錯誤修正
- 阻止一個未驗證的 server 清空彙總
tools/list- PR #31684 - 將
tools/list驗證失敗在單一 server 路由上顯示為 401 challenge - PR #31921 - 透過 OBO/passthrough-aware GET 路徑載入 MCP 工具組態工具 - PR #29960
- 收緊
/v1/mcp/server/submissions的基於角色可見性 - PR #31932 - 當已登入使用者缺少每位使用者的環境變數時,將 MCP 卡片標示為紅色 - PR #29856
- BYOM 可見性、預覽 UX 與 admin-settings 門檻控管 - PR #31809
- 重新加入聊天 UI,並允許 MCP OBO auth 使用簡易 UI - PR #31893
- 在 create-server 視窗於關閉狀態掛載時,讓進行中的 OAuth resume 不會重設 - PR #32416
- 阻止一個未驗證的 server 清空彙總
效能/負載平衡/可靠性改進
- 支出與 Auth 熱路徑
- 可靠性
- 路由
- 建置
- 將 wolfi-base digest 升級至 glibc 2.43-r10 - PR #32277
文件更新
- 在貢獻指南中,要求對回報的問題提供重現影片 - PR #30063
依歸屬區域彙整的 PR
依歸屬區域分類的 PR(總計:226)
- LLM API 端點:30
- UI:28
- MCP:28
- 模型與提供者:27
- 其他(CI / chore / tests / version bumps):24
- Auth 與管理:23
- 記錄:22
- 支出 / 預算 / Rate Limits:18
- 防護欄:12
- 效能:11
- 文件:2
- Secret Managers:1
新貢獻者
- @roytev 在 PR #29565 完成他們的第一次貢獻
- @balcsida 在 PR #29581 完成他們的第一次貢獻
- @PigeonMark 在 PR #29584 完成他們的第一次貢獻
- @johngarrido 在 PR #29623 完成他們的第一次貢獻
- @arnav-144p 在 PR #29753 完成他們的第一次貢獻
- @Kaihuang724 在 PR #29842 完成他們的第一次貢獻
- @fengjikui 在 PR #29890 完成他們的第一次貢獻
- @fernando-izar 在 PR #31632 完成他們的第一次貢獻