v1.81.12-stable.1 - 防護欄政策範本與動作建構器
部署此版本
- Docker
- Pip
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
ghcr.io/berriai/litellm:main-v1.81.12-stable.1
pip install litellm==1.81.12
重點亮點
- 政策範本 - 針對常見安全與合規使用案例(包含 NSFW、有毒內容與兒少安全)預先設定的防護欄政策範本
- 防護欄動作建構器 - 使用全新的 action-builder UI 與條件式執行支援,建置並自訂防護欄政策流程
- MCP OAuth2 M2M + Tracing - 為 MCP 伺服器新增 machine-to-machine OAuth2 支援,並為透過 AI Gateway 的 MCP 呼叫加入 OpenTelemetry tracing
- Responses API
shellTool 與context_management支援 - OpenAI Responses API 的伺服器端內容管理(compaction)與 Shell tool 支援 - 存取群組 - 建立存取群組以管理跨團隊與金鑰的模型、MCP 伺服器與代理程式存取
- 50+ 個全新的 Bedrock 區域模型項目 - DeepSeek V3.2、MiniMax M2.1、Kimi K2.5、Qwen3 Coder Next,以及 NVIDIA Nemotron Nano,涵蓋多個區域
- 新增 Semgrep 並修正 OOM - 靜態分析規則與記憶體用盡修正 - PR #20912
新增 Semgrep 並修正 OOM
此版本修正了因無界限 asyncio.Queue() 使用所造成的記憶體用盡(OOM)風險。記錄佇列(例如 GCS bucket)與 DB spend-update 佇列先前都沒有上限,在負載下可能無限制成長。它們現在使用可設定的最大大小(LITELLM_ASYNCIO_QUEUE_MAXSIZE,預設 1000);當滿載時,佇列會立即 flush 以騰出空間,而不是持續增加記憶體。另新增了一條 Semgrep 規則(.semgrep/rules/python/unbounded-memory.yml)以標記未來程式碼中類似的無界限記憶體模式。PR #20912
防護欄動作建構器
此版本新增了具條件式執行支援的防護欄政策視覺化動作建構器。您現在可以將防護欄串接成多步驟流程——如果簡單的防護欄失敗,就改為路由到進階防護欄,而不是立即封鎖。每個步驟都可設定 ON PASS 與 ON FAIL 動作(Next Step、Block 或 Allow),而且您可以在儲存前用範例訊息測試完整流程。

存取群組
存取群組可簡化您組織內資源存取的定義。一個群組即可授與模型、MCP 伺服器與代理程式的存取權——只要將其附加到金鑰或團隊即可。在 Admin UI 中建立群組、定義每個群組包含哪些資源,然後在建立金鑰或團隊時指派該群組。對群組的更新會自動套用到所有已附加的金鑰與團隊。
新的提供者與端點
新的提供者(2 個新增提供者)
| 提供者 | 支援的 LiteLLM 端點 | 說明 |
|---|---|---|
| Scaleway | /chat/completions | 用於聊天補全的 Scaleway Generative APIs |
| Sarvam AI | /chat/completions, /audio/transcriptions, /audio/speech | Sarvam AI 為印度語言提供 STT 與 TTS 支援 |
新模型 / 更新模型
新增模型支援(19 個重點模型)
| 提供者 | 模型 | 上下文視窗 | 輸入($/100萬 tokens) | 輸出($/100萬 tokens) |
|---|---|---|---|---|
| AWS Bedrock | deepseek.v3.2 | 164K | $0.62 | $1.85 |
| AWS Bedrock | minimax.minimax-m2.1 | 196K | $0.30 | $1.20 |
| AWS Bedrock | moonshotai.kimi-k2.5 | 262K | $0.60 | $3.00 |
| AWS Bedrock | moonshotai.kimi-k2-thinking | 262K | $0.73 | $3.03 |
| AWS Bedrock | qwen.qwen3-coder-next | 262K | $0.50 | $1.20 |
| AWS Bedrock | nvidia.nemotron-nano-3-30b | 262K | $0.06 | $0.24 |
| Azure AI | azure_ai/kimi-k2.5 | 262K | $0.60 | $3.00 |
| Vertex AI | vertex_ai/zai-org/glm-5-maas | 200K | $1.00 | $3.20 |
| MiniMax | minimax/MiniMax-M2.5 | 1M | $0.30 | $1.20 |
| MiniMax | minimax/MiniMax-M2.5-lightning | 1M | $0.30 | $2.40 |
| Dashscope | dashscope/qwen3-max | 258K | 分級定價 | 分級定價 |
| Perplexity | perplexity/preset/pro-search | - | 每次請求 | 每次請求 |
| Perplexity | perplexity/openai/gpt-4o | - | 每次請求 | 每次請求 |
| Perplexity | perplexity/openai/gpt-5.2 | - | 每次請求 | 每次請求 |
| Vercel AI Gateway | vercel_ai_gateway/anthropic/claude-opus-4.6 | 200K | $5.00 | $25.00 |
| Vercel AI Gateway | vercel_ai_gateway/anthropic/claude-sonnet-4 | 200K | $3.00 | $15.00 |
| Vercel AI Gateway | vercel_ai_gateway/anthropic/claude-haiku-4.5 | 200K | $1.00 | $5.00 |
| Sarvam AI | sarvam/sarvam-m | 8K | 免費方案 | 免費方案 |
| Anthropic | fast/claude-opus-4-6 | 1M | $30.00 | $150.00 |
注意:AWS Bedrock 模型可在多個區域使用(us-east-1、us-east-2、us-west-2、eu-central-1、eu-north-1、ap-northeast-1、ap-south-1、ap-southeast-3、sa-east-1)。總共新增了 54 個區域模型項目。
功能
-
- 使用
output_format參數在 Claude Opus 4.5 與 4.6 上啟用非 tool 結構化輸出 - PR #20548 - 在 prompt caching 中新增對
anthropic_messages呼叫類型的支援 - PR #19233 - 透過遠端 URL 取回管理 Anthropic Beta Headers - PR #20935, PR #21110
- 移除
x-anthropic-billing區塊 - PR #20951 - 對 OAuth token 使用 Authorization Bearer,而不是 x-api-key - PR #21039
- 篩除不支援的 JSON schema 約束以供結構化輸出 - PR #20813
- 為
/v1/messages新增 Claude Opus 4.6 功能 - PR #20733 - 修正
reasoning_effort=None與"none"在 Opus 4.6 應回傳 None - PR #20800
- 使用
-
- 支援帶有預設搜尋的 Perplexity Research API - PR #20860
-
- 新增 MiniMax-M2.5 與 MiniMax-M2.5-lightning 模型 - PR #21054
-
- 新增具有分級定價的
dashscope/qwen3-max模型 - PR #20919
- 新增具有分級定價的
-
- 新增 Vercel AI Anthropic 模型 - PR #20745
-
- 同步 DeepSeek 模型中繼資料並新增裸名稱 fallback - PR #20938
-
一般
錯誤修正
-
- 保留 Azure OpenAI 的
content_policy_violation錯誤詳細資訊 - PR #20883
- 保留 Azure OpenAI 的
LLM API 端點
功能
-
- 為 vector store 端點新增
target_model_names- PR #21089
- 為 vector store 端點新增
-
一般
錯誤
- 一般
管理端點 / UI
功能
-
存取群組
-
政策
-
SSO / 驗證
-
支出記錄
-
UI 改進
- Navbar:可選擇隱藏 Usage Popup - PR #20910
- Model 頁面:改善憑證訊息 - PR #21076
- Fallbacks:預設可設定為 10 個模型 - PR #21144
- 以箭頭與卡片結構顯示 fallback - PR #20922
- Team Info:遷移至 AntD Tabs + Table - PR #20785
- AntD 重構與 0 cost models 修正 - PR #20687
- Zscaler AI Guard UI - PR #21077
- 包含 Config Defined Pass Through Endpoints - PR #20898
- 在 MCP server 頁面將 "HTTP" 重新命名為 "Streamable HTTP (Recommended)" - PR #21000
- MCP server discovery UI - PR #21079
-
虛擬金鑰
錯誤
- Logs:修正輸入與輸出複製 - PR #20657
- Teams:修正可用 Teams - PR #20682
- Spend Logs:重設篩選器會重設自訂日期範圍 - PR #21149
- Usage:修正 Request Chart stack 變體 - PR #20894
- 新增 Auto Router:描述文字輸入框聚焦 - PR #21004
- Guardrail 編輯:LiteLLM Content Filter 類別 - PR #21002
- 為 API keys 表格中的 models 新增空值防護 - PR #20655
- 失敗請求顯示錯誤詳細資訊,而非 'Data Not Available' - PR #20656
- 修正 Spend Management Tests - PR #21088
- 修正 JWT email domain 驗證錯誤訊息 - PR #21212
AI 整合
記錄
-
- 修正不可序列化物件的 JSON 序列化錯誤 - PR #20668
-
- 清理標籤值以防止指標抓取失敗 - PR #20600
-
- 防止將空白 proxy request spans 傳送至 Langfuse - PR #19935
-
- 在設定 endpoint 時自動推斷
otlp_httpexporter - PR #20438
- 在設定 endpoint 時自動推斷
-
- 依 LIT-1907 更新 CBF 欄位對應 - PR #20906
-
一般
防護欄
-
政策範本
-
Pipeline 執行
-
- 為 ZGuard 新增團隊政策對應 - PR #20608
-
一般
- 為所有統一防護欄新增記錄 + 連結至自訂程式碼防護欄範本 - PR #20900
- 將 request headers +
litellm_version傳遞給一般防護欄 - PR #20729 - 空白
guardrails/policies陣列不應觸發企業授權檢查 - PR #20567 - 修正 OpenAI moderation 防護欄 - PR #20718
- 修正
/v2/guardrails/list回傳敏感值 - PR #20796 - 修正防護欄狀態錯誤 - PR #20972
- 在
initialize_custom_guardrail中重複使用get_instance_fn- PR #20917
支出追蹤、預算與速率限制
MCP 閘道 (12 項更新)
- MCP M2M OAuth2 支援 - 為 MCP servers 新增 machine-to-machine OAuth2 支援 - PR #20788
- MCP Server Discovery UI - 從 UI 瀏覽並探索可用的 MCP servers - PR #21079
- MCP Tracing - 為透過 AI Gateway 執行的 MCP 呼叫新增 OpenTelemetry tracing - PR #21018
- MCP OAuth2 Debug Headers - 用於 OAuth2 疑難排解的 client-side debug headers - PR #21151
- 修正 MCP「找不到 Session」錯誤 - 解決 session 持續化問題 - PR #21040
- 修正 MCP OAuth2 root endpoints 回傳「找不到 MCP server」 - PR #20784
- 修正 MCP OAuth2 query param 合併,當
authorization_url已包含參數時 - PR #20968 - 修正 Atlassian 上的 MCP SCOPES 問題 - PR #21150
- 修正 MCP StreamableHTTP backend - 使用
anyio.fail_after取代asyncio.wait_for- PR #20891 - 將
NPM_CONFIG_CACHE注入 STDIO MCP subprocess env - PR #21069 - 封鎖 MCP server 名稱與別名中的空格和連字號 - PR #21074
效能 / 負載平衡 / 可靠性改進 (8 項改進)
- 移除 queue 中的孤立項目 - 修正 scheduler queue 的記憶體洩漏 - PR #20866
- 移除重複的提供者解析,用於 budget limiter 熱路徑 - PR #21043
- 重試退避時使用目前的 retry exception,而非過時的 exception - PR #20725
- 新增 Semgrep 並修正 OOM - 靜態分析規則與記憶體不足修正 - PR #20912
- 新增 Pyroscope 用於持續剖析與可觀測性 - PR #21167
- 在共享 aiohttp sessions 下遵守
ssl_verify- PR #20349 - 修正共享健康檢查序列化 - PR #21119
- 將 model mismatch 記錄 從 WARNING 改為 DEBUG - PR #20994
資料庫變更
結構描述更新
| Table | Change Type | 說明 | PR | 移轉 |
|---|---|---|---|---|
LiteLLM_VerificationToken | New Indexes | 新增 user_id+team_id、team_id,以及 budget_reset_at+expires 的索引 | PR #20736 | Migration |
LiteLLM_PolicyAttachmentTable | 新欄位 | 為 policy-to-tag connections 新增 tags text array | PR #21061 | Migration |
LiteLLM_AccessGroupTable | New Table | 用於管理 model、MCP server 與 agent 存取的 access groups | PR #21022 | Migration |
LiteLLM_AccessGroupTable | Column Change | 將 access_model_ids 重新命名為 access_model_names | PR #21166 | Migration |
LiteLLM_ManagedVectorStoreTable | New Table | 搭配 model mappings 的受管理 vector store 追蹤 | - | Migration |
LiteLLM_TeamTable, LiteLLM_VerificationToken | 新欄位 | 新增 access_group_ids text array | PR #21022 | Migration |
LiteLLM_GuardrailsTable | 新欄位 | 新增 team_id text column | - | Migration |
文件更新 (14 項更新)
- 在 v1.81.9 release notes 中新增 LiteLLM Observatory 章節 - PR #20675
- 在 release notes 中新增 callback 註冊最佳化 - PR #20681
- Middleware 效能部落格文章 - PR #20677
- UI Team Soft Budget 文件 - PR #20669
- UI Contributing and Troubleshooting 指南 - PR #20674
- 重新組織 Admin UI 子區段 - PR #20676
- SDK proxy authentication (OAuth2/JWT auto-refresh) - PR #20680
- Forward client headers to LLM API 文件修正 - PR #20768
- 新增使用 policies 的文件指南 - PR #20914
- 為 Claude Opus 4.6 新增 native thinking 參數範例 - PR #20799
- 修正 Claude Code MCP 教學 - PR #21145
- 新增 Dashscope(International 與 China/Beijing)的 API base URLs - PR #21083
- 修正
DEFAULT_NUM_WORKERS_LITELLM_PROXY預設值(1,而非 4) - PR #21127 - 修正 README 中的 ElevenLabs 支援狀態 - PR #20643
新貢獻者
- @iver56 首次貢獻於 PR #20643
- @eliasaronson 首次貢獻於 PR #20666
- @NirantK 首次貢獻於 PR #19656
- @looksgood 首次貢獻於 PR #20919
- @kelvin-tran 首次貢獻於 PR #20548
- @bluet 首次貢獻於 PR #20873
- @itayov 首次貢獻於 PR #20729
- @CSteigstra 首次貢獻於 PR #20960
- @rahulrd25 首次貢獻於 PR #20569
- @muraliavarma 首次貢獻於 PR #20598
- @joaokopernico 首次貢獻於 PR #21039
- @datzscaler 首次貢獻於 PR #21077
- @atapia27 首次貢獻於 PR #20922
- @fpagny 首次貢獻於 PR #21121
- @aidankovacic-8451 首次貢獻於 PR #21119
- @luisgallego-aily 首次貢獻於 PR #19935