v1.80.5-stable - Gemini 3.0 支援
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.80.5-stable
pip install litellm
pip install litellm==1.80.5
主要亮點
- Gemini 3 - 支援 Gemini 3 模型的 Day-0,包含 thought signatures
- 提示管理 - 完整的提示版本控管支援,具備可編輯、測試與版本歷史的 UI
- MCP Hub - 在您的組織內發布並探索 MCP 伺服器
- 模型比較 UI - 並排模型比較介面,用於測試
- 批次 API 支出追蹤 - 針對批次與檔案建立請求的自訂中繼資料進行細緻的支出追蹤
- AWS IAM Secret Manager - 支援 AWS Secret Manager 的 IAM 角色驗證
- 記錄回呼控制 - 管理員層級控制,可防止呼叫端在合規環境中停用記錄回呼
- Proxy CLI JWT 驗證 - 讓開發者可使用 Proxy CLI 透過 LiteLLM AI Gateway 進行驗證
- 批次 API 路由 - 使用 config.yaml 中模型專屬憑證,將批次作業路由至不同的提供者帳戶
提示管理
本版本推出 LiteLLM Prompt Studio - 一套直接內建於 LiteLLM UI 的完整提示管理解決方案。您可以在不離開瀏覽器的情況下建立、測試與管理提示版本。
您現在可以在 LiteLLM Prompt Studio 中執行以下操作:
- 建立與測試提示:使用開發者訊息(system 指令)建立提示,並透過互動式聊天介面即時測試
- 動態變數:使用
{{variable_name}}語法建立可重複使用的提示範本,並自動偵測變數 - 版本控制:每次提示更新都會自動版本化,並完整追蹤版本歷史與回復功能
- Prompt Studio:在專用的工作室環境中編輯提示,並提供即時測試與預覽
API 整合:
使用簡單的 API 呼叫即可在任何應用程式中使用您的提示:
response = client.chat.completions.create(
model="gpt-4",
extra_body={
"prompt_id": "your-prompt-id",
"prompt_version": 2, # Optional: specify version
"prompt_variables": {"name": "value"} # Optional: pass variables
}
)
從這裡開始: LiteLLM 提示管理文件
效能 – /realtime 低 182× 的 p99 延遲
這次更新透過移除熱路徑上的冗餘編碼、重複使用共用 SSL context,以及快取原本會在每次請求中重新產生兩次、但很少變動的格式化字串,來降低 /realtime 延遲。
結果
| 指標 | 更新前 | 更新後 | 改善幅度 |
|---|---|---|---|
| 中位數延遲 | 2,200 ms | 59 ms | −97%(約快 37×) |
| p95 延遲 | 8,500 ms | 67 ms | −99%(約快 127×) |
| p99 延遲 | 18,000 ms | 99 ms | −99%(約快 182×) |
| 平均延遲 | 3,214 ms | 63 ms | −98%(約快 51×) |
| RPS | 165 | 1,207 | +631%(約增加 7.3×) |
測試設定
| 類別 | 規格 |
|---|---|
| 負載測試 | Locust:1,000 個並行使用者,500 個 ramp-up |
| 系統 | 4 vCPUs、8 GB RAM、4 workers、4 instances |
| 資料庫 | PostgreSQL(未使用 Redis) |
| 設定 | config.yaml |
| 負載腳本 | no_cache_hits.py |
模型比較 UI
新的互動式 playground UI 可讓您並排比較多個 LLM 模型,方便評估與比較模型回應。
功能:
- 即時比較多個模型的回應
- 並排檢視與同步捲動
- 支援所有 LiteLLM 支援的模型
- 依模型追蹤成本
- 回應時間比較
- 預先設定的提示,方便快速測試
詳細資訊:
-
參數化:設定 API 金鑰、端點、模型與模型參數,以及互動類型(chat completions、embeddings 等)
-
模型比較:最多可同時比較 3 個不同模型,並以並排回應檢視呈現
-
比較指標:檢視詳細比較資訊,包括:
- 首個 token 出現時間
- 輸入 / 輸出 / 推理 tokens
- 總延遲
- 成本(若已在 config 中啟用)
-
安全過濾器:直接在 playground 介面設定並測試 guardrails(安全過濾器)
新提供者與端點
新提供者
| 提供者 | 支援的端點 | 說明 |
|---|---|---|
| Docker Model Runner | /v1/chat/completions | 在 Docker 容器中執行 LLM 模型 |
新模型 / 更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | 輸入($/1M tokens) | 輸出($/1M tokens) | 功能 |
|---|---|---|---|---|---|
| Azure | azure/gpt-5.1 | 272K | $1.38 | $11.00 | 推理、視覺、PDF 輸入、responses API |
| Azure | azure/gpt-5.1-2025-11-13 | 272K | $1.38 | $11.00 | 推理、視覺、PDF 輸入、responses API |
| Azure | azure/gpt-5.1-codex | 272K | $1.38 | $11.00 | responses API、推理、視覺 |
| Azure | azure/gpt-5.1-codex-2025-11-13 | 272K | $1.38 | $11.00 | responses API、推理、視覺 |
| Azure | azure/gpt-5.1-codex-mini | 272K | $0.275 | $2.20 | responses API、推理、視覺 |
| Azure | azure/gpt-5.1-codex-mini-2025-11-13 | 272K | $0.275 | $2.20 | responses API、推理、視覺 |
| Azure EU | azure/eu/gpt-5-2025-08-07 | 272K | $1.375 | $11.00 | 推理、視覺、PDF 輸入 |
| Azure EU | azure/eu/gpt-5-mini-2025-08-07 | 272K | $0.275 | $2.20 | 推理、視覺、PDF 輸入 |
| Azure EU | azure/eu/gpt-5-nano-2025-08-07 | 272K | $0.055 | $0.44 | 推理、視覺、PDF 輸入 |
| Azure EU | azure/eu/gpt-5.1 | 272K | $1.38 | $11.00 | 推理、視覺、PDF 輸入、responses API |
| Azure EU | azure/eu/gpt-5.1-codex | 272K | $1.38 | $11.00 | responses API、推理、視覺 |
| Azure EU | azure/eu/gpt-5.1-codex-mini | 272K | $0.275 | $2.20 | responses API、推理、視覺 |
| Gemini | gemini-3-pro-preview | 2M | $1.25 | $5.00 | 推理、視覺、function calling |
| Gemini | gemini-3-pro-image | 2M | $1.25 | $5.00 | 影像生成、推理 |
| OpenRouter | openrouter/deepseek/deepseek-v3p1-terminus | 164K | $0.20 | $0.40 | function calling、推理 |
| OpenRouter | openrouter/moonshot/kimi-k2-instruct | 262K | $0.60 | $2.50 | function calling、網頁搜尋 |
| OpenRouter | openrouter/gemini/gemini-3-pro-preview | 2M | $1.25 | $5.00 | 推理、視覺、function calling |
| XAI | xai/grok-4.1-fast | 2M | $0.20 | $0.50 | 推理、function calling |
| Together AI | together_ai/z-ai/glm-4.6 | 203K | $0.40 | $1.75 | function calling、推理 |
| Cerebras | cerebras/gpt-oss-120b | 131K | $0.60 | $0.60 | 函式呼叫 |
| Bedrock | anthropic.claude-sonnet-4-5-20250929-v1:0 | 200K | $3.00 | $15.00 | 電腦使用、推理、視覺 |
功能
-
Gemini (Google AI Studio + Vertex AI)
- 新增 Day 0 gemini-3-pro-preview 支援 - PR #16719
- 新增 Gemini 3 Pro Image 模型支援 - PR #16938
- 在啟用 tools 時,為串流回應新增 reasoning_content - PR #16854
- 為 Gemini 3 reasoning_effort 新增 includeThoughts=True - PR #16838
- 在 responses API 中支援 Gemini 3 的 thought signatures - PR #16872
- 修正 gemma 的 system message 處理錯誤 - PR #16767
- Gemini 3 Pro Image:擷取 image_tokens 並支援 cost_per_output_image - PR #16912
- 修正 gemini-2.5-flash-image 缺少成本 - PR #16882
- Gemini 3 在 tool call id 中的 thought signatures - PR #16895
-
- Snowflake 提供者支援:新增 embeddings、PAT、account_id - PR #15727
-
- 為 OCI Dedicated Endpoints 新增 oci_endpoint_id 參數 - PR #16723
-
- 新增 Grok 4.1 Fast 模型支援 - PR #16936
-
- 新增來自 together.ai 的 GLM 4.6 - PR #16942
-
- 修正 Cerebras GPT-OSS-120B 模型名稱 - PR #16939
錯誤修正
-
一般
LLM API 端點
功能
錯誤
管理端點 / UI
功能
-
Proxy CLI 驗證
- 允許使用 JWT 透過 Proxy CLI 登入 - PR #16756
-
虛擬金鑰
- 修正 Key Model Alias 無法運作 - PR #16896
-
模型 + 端點
-
團隊
- Teams table 空白狀態 - PR #16738
-
備援
- Fallbacks 圖示按鈕提示與刪除時的摩擦 - PR #16737
-
MCP 伺服器
- 刪除使用者與 MCP Server Modal、MCP Table 提示 - PR #16751
-
回呼
-
用量與分析
- 允許在 User Table 中對使用者 ID 進行部分比對 - PR #16952
-
一般 UI
錯誤
-
UI 修正
- 修正因 antd Notification Manager 導致的不穩定測試 - PR #16740
- 修正 UI MCP Tool 測試回歸 - PR #16695
- 修正編輯記錄設定未顯示 - PR #16798
- 在請求檢視器中新增用於截斷長 request id 的 CSS - PR #16665
- 移除 Add Model 中 Azure 的 Placeholder 內的 azure/ 前綴 - PR #16597
- 從 user/info 回傳中移除 UI Session Token - PR #16851
- 移除 model 分頁中的 console logs 和 errors - PR #16455
- 變更 Bulk Invite User Roles 以符合後端 - PR #16906
- Mock Tremor 的 Tooltip 以修正不穩定的 UI 測試 - PR #16786
- 修正 e2e ui playwright 測試 - PR #16799
- 修正 CI/CD 中的測試 - PR #16972
-
SSO
-
驗證
-
Swagger UI
- 修正由 Pydantic v2
$defs未正確公開於 OpenAPI schema 所導致的 chat completion endpoints Swagger UI resolver errors - PR #16784
- 修正由 Pydantic v2
AI 整合
記錄
-
- 過濾 Langfuse 的 secret fields - PR #16842
-
一般
防護欄
-
- 修正 IBM Guardrails 的可選參數,新增 extra_headers 欄位 - PR #16771
-
- 在標記時對 Grayswan guardrail 進行 passthrough - PR #16891
-
一般防護欄
- 修正 prompt injection 無法運作 - PR #16701
提示詞管理
- Prompt Management
- 允許在對 model 的請求中只指定 prompt_id - PR #16834
- 新增提示詞版本控管支援 - PR #16836
- 允許將 prompt version 儲存在 DB 中 - PR #16848
- 新增編輯提示詞的 UI - PR #16853
- 允許使用 Chat UI 測試提示詞 - PR #16898
- 允許檢視版本歷程 - PR #16901
- 允許在程式碼中指定 prompt version - PR #16929
- UI,允許查看 Prompt 的 model、prompt id - PR #16932
- 顯示 prompt management 的「取得程式碼」區塊 + 小幅潤飾版本歷程顯示 - PR #16941
密鑰管理員
- AWS Secrets Manager
- 新增 AWS Secret Manager 的 IAM role 假設支援 - PR #16887
MCP 閘道
- MCP Hub - 在公司內發布/探索 MCP Servers - PR #16857
- MCP Resources - MCP resources 支援 - PR #16800
- MCP OAuth - 文件 - mcp oauth flow 詳情 - PR #16742
- MCP Lifecycle - 移除 MCPClient.connect 並使用 run_with_session lifecycle - PR #16696
- MCP Server IDs - 新增 mcp server ids - PR #16904
- MCP URL Format - 修正 mcp url format - PR #16940
效能/負載平衡/可靠性改善
- 即時端點效能 - 修正降低即時端點效能的瓶頸 - PR #16670
- SSL Context 快取 - 快取 SSL contexts 以避免過度記憶體配置 - PR #16955
- 快取最佳化 - 修正 cache cooldown key generation - PR #16954
- 路由器快取 - 修正對於具有相同可快取前綴但不同使用者訊息的請求之路由 - PR #16951
- Redis Event Loop - 修正第一次呼叫時 redis event loop 被關閉 - PR #16913
- 相依性管理 - 將 pydantic 升級至版本 2.11.0 - PR #16909
文件更新
-
提供者文件
-
API 文件
-
一般文件
- 將 mini-swe-agent 新增至 LiteLLM 上建置的 Projects - PR #16971
基礎架構/CI/CD
新貢獻者
- @mattmorgis 首次貢獻於 PR #16371
- @mmandic-coatue 首次貢獻於 PR #16732
- @Bradley-Butcher 首次貢獻於 PR #16725
- @BenjaminLevy 首次貢獻於 PR #16757
- @CatBraaain 首次貢獻於 PR #16767
- @tushar8408 首次貢獻於 PR #16831
- @nbsp1221 首次貢獻於 PR #16845
- @idola9 首次貢獻於 PR #16832
- @nkukard 首次貢獻於 PR #16864
- @alhuang10 首次貢獻於 PR #16852
- @sebslight 首次貢獻於 PR #16838
- @TsurumaruTsuyoshi 首次貢獻於 PR #16905
- @cyberjunk 首次貢獻於 PR #16492
- @colinlin-stripe 首次貢獻於 PR #16895
- @sureshdsk 首次貢獻於 PR #16883
- @eiliyaabedini 首次貢獻於 PR #16875
- @justin-tahara 首次貢獻於 PR #16957
- @wangsoft 首次貢獻於 PR #16913
- @dsduenas 首次貢獻於 PR #16891
已知問題
/audit和/user/available_users路由回傳 404。已在 PR #17337 修正