跳至主要內容

v1.79.3-stable - 內建 AI Gateway 防護欄

部署此版本

docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.79.3-stable

主要亮點

  • LiteLLM 自訂防護欄 - 具備 UI 設定支援的內建防護欄
  • 效能改善 - /responses API 延遲中位數降低 19×
  • Veo3 影片生成(Vertex AI + Google AI Studio) - 使用 OpenAI Video API 搭配 Vertex AI 與 Google AI Studio Veo3 模型來生成影片

AI Gateway 上的內建防護欄


此版本為 LiteLLM AI Gateway 引入內建防護欄,讓您無須依賴外部防護欄 API 即可強制執行保護措施。

  • 封鎖關鍵字 - 封鎖已知的敏感關鍵字,例如 "litellm"、"python" 等。
  • 模式偵測 - 封鎖已知的敏感模式,例如電子郵件、社會安全號碼、API 金鑰等。
  • 自訂 Regex 模式 - 為您的特定使用情境定義自訂 regex 模式。

請在 此處 開始使用 AI Gateway 的內建防護欄。


效能 – /responses 19× 更低的延遲中位數

此更新透過整合我們用於連線處理的內部網路管理,顯著改善了 /responses 延遲,消除了每次請求的初始化額外負擔。

結果

指標之前之後改善
延遲中位數3,600 ms190 ms−95%(快約 19×)
p95 延遲4,300 ms280 ms−93%
p99 延遲4,600 ms590 ms−87%
平均延遲3,571 ms208 ms−94%
RPS2311,059+358%

測試設定

類別規格
負載測試Locust:1,000 個並發使用者,500 個逐步升載
系統4 vCPUs、8 GB RAM、4 個 workers、4 個 instances
資料庫PostgreSQL(未使用 Redis)
設定config.yaml
負載腳本no_cache_hits.py

新模型 / 已更新模型

新模型支援

提供者模型上下文視窗輸入($/100 萬 tokens)輸出($/100 萬 tokens)功能
Azureazure/gpt-5-pro272K$15.00$120.00Responses API、reasoning、vision、PDF input
Azureazure/gpt-image-1-mini---影像生成 - 依像素定價
Azureazure/container---Container API - $0.03/session
OpenAIopenai/container---Container API - $0.03/session
Coherecohere/embed-v4.0128K$0.12-支援圖片輸入的 embeddings
Geminigemini/gemini-live-2.5-flash-preview-native-audio-09-20251M$0.30$2.00原生 audio、vision、web search
Vertex AIvertex_ai/minimaxai/minimax-m2-maas196K$0.30$1.20Function calling、tool choice
NVIDIAnvidia/nemotron-nano-9b-v2---聊天補全

OCR 模型

提供者模型每頁成本功能
Azure AIazure_ai/doc-intelligence/prebuilt-read$0.0015文件閱讀
Azure AIazure_ai/doc-intelligence/prebuilt-layout$0.01版面分析
Azure AIazure_ai/doc-intelligence/prebuilt-document$0.01文件處理
Vertex AIvertex_ai/mistral-ocr-2505$0.0005OCR 處理

搜尋模型

提供者模型定價功能
Firecrawlfirecrawl/search分級:$0.00166-$0.0166/查詢每次查詢 10-100 筆結果
SearXNGsearxng/search免費開源 metasearch

功能

  • Azure

    • 新增 Azure GPT-5-Pro Responses API 支援與 reasoning 功能 - PR #16235
    • 新增 Azure 的 gpt-image-1-mini 定價與品質等級(low/medium/high) - PR #16182
    • 新增在 Azure OpenAI 發生 exceptions 時回傳 Azure Content Policy 錯誤資訊的支援 - PR #16231
    • 修正 Azure GPT-5 錯誤路由至 O-series 設定(不支援 temperature 參數) - PR #16246
    • 修正 Azure 不接受額外的 body 參數 - PR #16116
    • 修正 Azure DALL-E-3 健康檢查的內容政策違規問題,改用安全的預設提示詞 - PR #16329
  • Bedrock

    • 修正 AWS Bedrock Converse API 中空白 assistant 訊息的處理,以避免 400 Bad Request 錯誤 - PR #15850
    • 修正:從 Bedrock InvokeModel request body 中過濾 AWS 驗證參數 - PR #16315
    • 修正 Bedrock proxy 在 file content 中新增 name,當使用 cache_control 時會造成失敗 - PR #16275
    • 修正 global.anthropic.claude-haiku-4-5-20251001-v1:0 的 supports_reasoning 標記並更新定價 - PR #16263
  • Gemini(Google AI Studio + Vertex AI)

    • 在 model map 中新增 gemini live audio model 成本 - PR #16183
    • 修正 Gemini parallel tool calls 的翻譯問題 - PR #16194
    • 修正:透過 x-goog-api-key header 搭配自訂 api_base 傳送 Gemini API key - PR #16085
    • 修正 image_config.aspect_ratio 對 gemini-2.5-flash-image 無效的問題 - PR #15999
    • 修正 Gemini minimal reasoning 環境變數覆寫導致 thoughts 停用的問題 - PR #16347
    • 修正 gemini-2.5-flash 的 cache_read_input_token_cost - PR #16354
  • Anthropic

    • 修正 VertexAI 的 Anthropic token 計數 - PR #16171
    • 修正 anthropic-adapter:正確將 Anthropic 影像格式轉換為 OpenAI - PR #16202
    • 在 Databricks 上為 Claude 啟用自動化提示快取訊息格式 - PR #16200
    • 新增對 Anthropic Memory Tool 的支援 - PR #16115
    • 傳遞模型資訊的 cache 建立/讀取 token 成本,以修正 Anthropic 長上下文成本計算 - PR #16376
  • Vertex AI

    • 新增 Vertex MiniMAX m2 模型支援 - PR #16373
    • 正確將 429 Resource Exhausted 對應至 RateLimitError - PR #16363
    • 新增 vertex_credentialslitellm.rerank() 的支援,用於 Vertex AI - PR #16266
  • Databricks

  • Deepgram

    • 在請求需要時回傳 diarized transcript - PR #16133
  • Fireworks

    • 將 Fireworks audio endpoints 更新為新的 api.fireworks.ai domains - PR #16346
  • Cohere

    • 新增 cohere embed-v4.0 模型支援 - PR #16358
  • Watsonx

    • 支援 reasoning_effort 用於 watsonx chat models - PR #16261
  • OpenAI

    • 移除 reasoning_effort 轉換中的自動摘要 - PR #16210
  • XAI

    • 移除 Grok 4 Models 的 Reasoning Effort 參數 - PR #16265
  • Hosted VLLM

    • 修正 HostedVLLMRerankConfig 不會被使用 - PR #16352

新增提供者支援


LLM API 端點

功能

錯誤修正

  • 一般
    • 修正在串流模式下,當 n>1 且有工具呼叫時,index 欄位未填入 - PR #15962
    • 在 litellm_params 中傳遞 aws_region_name - PR #16321
    • 新增 retry-after 標頭支援,用於錯誤 502503504 - PR #16288

管理端點 / UI

功能

  • 虛擬金鑰

    • UI - 刪除團隊成員時增加摩擦 - PR #16167
    • UI - Litellm 測試金鑰音訊支援 - PR #16251
    • UI - 測試金鑰頁面恢復模型為單選 - PR #16390
  • 模型 + 端點

    • UI - 新增模型既有憑證改善 - PR #16166
    • UI - 新增 Azure AD Token 欄位,且 Azure API Key 為選用 - PR #16331
    • UI - 修正模型建立流程中 vLLM 的標籤 - PR #16285
    • UI - 在團隊模型表格中包含模型存取群組模型 - PR #16298
    • 修正 /model_group/info 對 SSO 使用者回傳完整模型清單 - PR #16296
    • 修正 Litellm 非 root docker Model Hub 表格 - PR #16282
  • 防護欄

    • UI - 修正防護欄實體無法被選取且未顯示的回歸問題 - PR #16165
    • UI - 防護欄資訊頁顯示 PII 設定 - PR #16164
    • 將 guardrail_information 變更為 list 類型 - PR #16127
    • UI - LiteLLM 防護欄 - 確保您可以看到 PII Patterns 的 UI 友善名稱 - PR #16382
    • UI - 防護欄 - LiteLLM 內容過濾器,允許檢視/編輯內容過濾器設定 - PR #16383
    • UI - 防護欄 - 允許透過 UI 更新防護欄。確保 litellm_params 實際上會在記憶體中更新 - PR #16384
  • SSO 設定

    • 支援 ui sso 上的點號表示法 - PR #16135
    • UI - 防止 sso proxy base url 輸入中出現尾端斜線 - PR #16244
    • UI - SSO Proxy Base URL 輸入驗證並移除標準化 / - PR #16332
    • UI - 在建立流程中顯示 SSO 建立錯誤 - PR #16369
  • 使用情況與分析

    • UI - 標記使用情況頂部模型表格檢視與標籤修正 - PR #16249
    • UI - Litellm 使用日期選擇器 - PR #16264
  • 快取設定

    • UI - 快取設定 Redis 新增語意快取設定 - PR #16398

錯誤修正

  • 一般
    • UI - 移除 embedding models 請求中的 encoding_format - PR #16367
    • UI - 還原測試金鑰多模型選擇的變更 - PR #16372
    • UI - 各種小問題 - PR #16406

AI 整合

記錄

  • Langfuse

    • 修正 langfuse 快取 token 的輸入 token 邏輯 - PR #16203
  • Opik

    • 修正錯誤:無法正確附加到既有 trace,並進行重構 - PR #15529
  • S3

    • S3 logger,新增在使用 minio logger 時對 ssl_verify 的支援 - PR #16211
    • 移除 s3 中的 base64 - PR #16157
    • 新增允許以 Key 為基礎的前綴到 s3 path - PR #16237
    • 新增 Prometheus 指標以追蹤 S3 中的 callback 記錄失敗 - PR #16209
  • OpenTelemetry

    • OTEL - 在 OTEL Logger 上記錄成本明細 - PR #16334
  • DataDog

    • 新增對 datadog callback 的 DD Agent Host 支援 - PR #16379

防護欄

密鑰管理員


支出追蹤、預算與速率限制

  • 成本追蹤
    • 修正 OpenAI Responses API 串流測試的 usage 欄位名稱與成本計算 - PR #16236

MCP 閘道

  • 組態

效能 / 負載平衡 / 可靠性改善

  • 記憶體洩漏修正

    • 解決由 Pydantic 2.11+ 棄用警告造成的記憶體累積 - PR #16110
  • 工作階段管理

    • 為 responses API 新增 shared_session 支援 - PR #16260
  • 錯誤處理

    • 在串流期間優雅處理連線已關閉錯誤 - PR #16294
    • 處理每日支出排序鍵中的 None 值 - PR #16245
  • 組態

    • 移除快取控制注入索引的最小驗證 - PR #16149
    • 改善清除邏輯 - 僅移除未訪問的端點 - PR #16400
  • Redis

    • 處理來自 AWS ElastiCache Valkey 的浮點數 redis_version - PR #16207
  • Hook

    • 在 during_call_hook 中新增平行執行處理 - PR #16279
  • 基礎架構

    • 為 prisma 安裝執行階段 node - PR #16410

文件更新

  • 提供者文件

    • 文件 - v1.79.1 - PR #16163
    • 修正 model_management.md 上的損壞連結 - PR #16217
    • 修正圖像生成回應格式 - 使用 'images' 陣列而非 'image' 物件 - PR #16378
  • 一般文件

    • 新增正式環境的最低資源需求 - PR #16146
    • 新增與其他 AI 閘道的基準比較 - PR #16248
    • LiteLLM 內容過濾防護欄文件 - PR #16413
    • 修正 orginal 一詞的拼字錯誤 - PR #16255
  • 安全性

    • 移除 tornado 測試檔案(包含 test.key),修正 Python 3.13 安全性問題 - PR #16342

新貢獻者

  • @steve-gore-snapdocs 在 PR #16149 做出了他們的首次貢獻
  • @timbmg 在 PR #16120 做出了他們的首次貢獻
  • @Nivg 在 PR #16202 做出了他們的首次貢獻
  • @pablobgar 在 PR #16194 做出了他們的首次貢獻
  • @AlanPonnachan 在 PR #16150 做出了他們的首次貢獻
  • @Chesars 在 PR #16236 做出了他們的首次貢獻
  • @bowenliang123 在 PR #16255 做出了他們的首次貢獻
  • @dean-zavad 在 PR #16199 做出了他們的首次貢獻
  • @alexkuzmik 在 PR #15529 做出了他們的首次貢獻
  • @Granine 在 PR #16281 做出了他們的首次貢獻
  • @Oodapow 在 PR #16279 做出了他們的首次貢獻
  • @jgoodyear 在 PR #16275 做出了他們的首次貢獻
  • @Qanpi 在 PR #16321 做出了他們的首次貢獻
  • @ShimonMimoun 在 PR #16313 做出了他們的首次貢獻
  • @andriykislitsyn 在 PR #16288 做出了他們的首次貢獻
  • @reckless-huang 在 PR #16263 做出了他們的首次貢獻
  • @chenmoneygithub 在 PR #16368 做出了他們的首次貢獻
  • @stembe-digitalex 在 PR #16354 做出了他們的首次貢獻
  • @jfcherng 在 PR #16352 做出了他們的首次貢獻
  • @xingyaoww 在 PR #16246 做出了他們的首次貢獻
  • @emerzon 在 PR #16373 做出了他們的首次貢獻
  • @wwwillchen 在 PR #16376 做出了他們的首次貢獻
  • @fabriciojoc 在 PR #16203 做出了他們的首次貢獻
  • @jroberts2600 在 PR #16273 做出了他們的首次貢獻

完整變更記錄

在 GitHub 上查看完整變更記錄