v1.82.3 - Nebius AI、gpt-5.4、Gemini 3.x、FLUX Kontext,以及 116 個新模型
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
ghcr.io/berriai/litellm:main-1.82.3-stable
pip install litellm
pip install litellm==1.82.3
重點摘要
- Nebius AI — 新提供者 — 透過 Nebius AI 雲端可用的 30 個模型,涵蓋 DeepSeek、Qwen、Llama、Mistral、NVIDIA 與 BAAI - PR #22614
- OpenAI gpt-5.4 / gpt-5.4-pro — 第 0 天 — 在 OpenAI 與 Azure 上完整支援
gpt-5.4(1M context,$2.50/$15.00)以及gpt-5.4-pro($30.00/$180.00)的定價與路由 - Gemini 3.x 模型 —
gemini-3-flash-preview、gemini-3.1-pro-preview、gemini-3.1-flash-image-preview、以及gemini-embedding-2-preview已加入 Google AI 與 Vertex AI 的成本對照表 - FLUX Kontext 影像編輯 —
flux-kontext-pro和flux-kontext-max已加入 Black Forest Labs,另包含flux-pro-1.0-fill和flux-pro-1.0-expand用於 inpainting 與 outpainting - 116 個新模型、132 個已棄用模型清理完成 — 主要模型對照表更新,包括 Mistral Magistral、Dashscope Qwen3 VL、透過 Azure AI 的 xAI Grok、ZAI GLM-5、Serper Search;移除 OpenAI GPT-3.5/GPT-4 舊版變體、Gemini 1.5,以及 Vertex AI PaLM2
- SageMaker Nova 提供者 — Amazon Nova 模型在 SageMaker 上的新
sagemaker_nova提供者 - PR #21542 - Hashicorp Vault 密鑰管理員 — 由 Hashicorp Vault 驅動的設定覆寫後端,並提供完整 UI 來管理來自 vault 的憑證 - PR #22939, PR #23036
- Responses API WebSocket 串流 — Responses API 的即時 WebSocket 串流,包含所有提供者的支援 - PR #22559, PR #22771
- Org Admin RBAC 擴充 — Org Admin 現在可以存取團隊管理端點、檢視並邀請內部使用者,以及管理團隊成員資格,而不需要全域管理員角色 - PR #23085, PR #23080
- 防護欄模式預設值與基於標籤的模式 — 全域設定預設的防護欄模式清單,並在基於標籤的防護欄設定中指定模式清單 - PR #22676, PR #23020
- 記錄中的機密遮罩 — 所有 proxy 記錄輸出中的 API 金鑰、token 與憑證會自動遮罩。預設啟用;可透過
LITELLM_DISABLE_REDACT_SECRETS=true停用 - PR #23668 - 串流穩定性修正 — 修正
RuntimeError: Cannot send a request, as the client has been closed.在 production 中約 1 小時後當機的嚴重問題 - PR #22926
新提供者與端點
新提供者(7 個新提供者)
| 提供者 | 支援的 LiteLLM 端點 | 說明 |
|---|---|---|
Nebius AI (nebius/) | /chat/completions, /embeddings | 以 EU 為 ভিত্ত的 AI 雲端,提供 30+ 個開放模型——DeepSeek、Qwen3、Llama 3.1/3.3、NVIDIA Nemotron、BAAI embeddings |
ZAI (zai/) | /chat/completions | 透過 ZAI 雲端提供的 ZhipuAI GLM-5 模型 |
Black Forest Labs (black_forest_labs/) | /images/generations, /images/edits | FLUX 影像生成與編輯——Kontext Pro/Max、Pro 1.0 Fill/Expand |
Serper (serper/) | /search | 透過 Serper API 進行網頁搜尋 |
SageMaker Nova (sagemaker_nova/) | /chat/completions | 透過 SageMaker 端點提供 Amazon Nova 模型 |
Google Search API (google_search/) | /search | Google Search API 整合 - PR #22752 |
Bedrock Mantle (bedrock_mantle/) | /chat/completions | 透過 Mantle 使用 Amazon Bedrock——Bedrock 模型的替代驗證與路由路徑 - PR #22866 |
新模型 / 更新模型
新模型支援(116 個新模型)
| 提供者 | 模型 | 上下文視窗 | 輸入($/百萬 tokens) | 輸出($/百萬 tokens) | 功能 |
|---|---|---|---|---|---|
| OpenAI | gpt-5.4 | 1.05M | $2.50 | $15.00 | chat, vision, tools, reasoning |
| OpenAI | gpt-5.4-pro | 1.05M | $30.00 | $180.00 | responses, vision, tools, reasoning |
| OpenAI | gpt-5.3-chat-latest | 128K | $1.75 | $14.00 | chat, vision, tools, reasoning |
| Azure OpenAI | azure/gpt-5.4 | 1.05M | $2.50 | $15.00 | chat, vision, tools, reasoning |
| Azure OpenAI | azure/gpt-5.4-pro | 1.05M | $30.00 | $180.00 | responses, vision, tools, reasoning |
| Azure OpenAI | azure/gpt-5.3-chat | 128K | $1.75 | $14.00 | chat, vision, tools, reasoning |
| Google Gemini | gemini/gemini-3-flash-preview | 1M | $0.50 | $3.00 | chat, vision, tools, reasoning |
| Google Gemini | gemini/gemini-3.1-pro-preview | 1M | $2.00 | $12.00 | chat, vision, tools, reasoning |
| Google Gemini | gemini/gemini-3.1-flash-image-preview | 65K | $0.25 | $1.50 | image generation, vision |
| Google Gemini | gemini/gemini-3.1-flash-lite-preview | - | - | - | 聊天 |
| Google Gemini | gemini/gemini-3-pro-image-preview | - | - | - | 影像生成 |
| Google Gemini | gemini/gemini-embedding-2-preview | 8K | $0.20 | - | 嵌入 |
| Google Vertex AI | vertex_ai/gemini-3-flash-preview | - | - | - | 聊天 |
| Google Vertex AI | vertex_ai/gemini-3.1-pro-preview | - | - | - | 聊天 |
| Google Vertex AI | vertex_ai/gemini-3.1-flash-lite-preview | - | - | - | 聊天 |
| Google Vertex AI | vertex_ai/gemini-embedding-2-preview | - | $0.20 | - | 嵌入 |
| Mistral | mistral/magistral-medium-1-2-2509 | 40K | $2.00 | $5.00 | chat, tools, reasoning |
| Mistral | mistral/magistral-small-1-2-2509 | 40K | $0.50 | $1.50 | chat, tools, reasoning |
| Mistral | mistral/mistral-large-2512 | 262K | $0.50 | $1.50 | chat, vision, tools |
| Mistral | mistral/mistral-medium-3-1-2508 | - | - | - | 聊天 |
| Mistral | mistral/mistral-small-3-2-2506 | - | - | - | 聊天 |
| Mistral | mistral/ministral-3-3b-2512 | - | - | - | 聊天 |
| Mistral | mistral/ministral-3-8b-2512 | - | - | - | 聊天 |
| Mistral | mistral/ministral-3-14b-2512 | - | - | - | 聊天 |
| Black Forest Labs | black_forest_labs/flux-kontext-pro | - | - | - | 圖像編輯 |
| Black Forest Labs | black_forest_labs/flux-kontext-max | - | - | - | 圖像編輯 |
| Black Forest Labs | black_forest_labs/flux-pro-1.0-fill | - | - | - | 圖像編輯(inpaint) |
| Black Forest Labs | black_forest_labs/flux-pro-1.0-expand | - | - | - | 圖像編輯(outpaint) |
| Black Forest Labs | black_forest_labs/flux-pro-1.1 | - | - | - | 圖像生成 |
| Black Forest Labs | black_forest_labs/flux-pro-1.1-ultra | - | - | - | 圖像生成 |
| Black Forest Labs | black_forest_labs/flux-dev | - | - | - | 圖像生成 |
| Black Forest Labs | black_forest_labs/flux-pro | - | - | - | 圖像生成 |
| Azure AI | azure_ai/grok-4-1-fast-non-reasoning | 131K | $0.20 | $0.50 | chat, tools |
| Azure AI | azure_ai/grok-4-1-fast-reasoning | 131K | $0.20 | $0.50 | chat, tools, reasoning |
| Azure AI | azure_ai/mistral-document-ai-2512 | - | - | - | OCR |
| Dashscope | dashscope/qwen3-next-80b-a3b-instruct | 262K | $0.15 | $1.20 | 聊天 |
| Dashscope | dashscope/qwen3-next-80b-a3b-thinking | 262K | $0.15 | $1.20 | chat, reasoning |
| Dashscope | dashscope/qwen3-vl-235b-a22b-instruct | 131K | $0.40 | $1.60 | chat, vision |
| Dashscope | dashscope/qwen3-vl-235b-a22b-thinking | 131K | $0.40 | $4.00 | chat, vision, reasoning |
| Dashscope | dashscope/qwen3-vl-32b-instruct | 131K | $0.16 | $0.64 | chat, vision |
| Dashscope | dashscope/qwen3-vl-32b-thinking | 131K | $0.16 | $2.87 | chat, vision, reasoning |
| Dashscope | dashscope/qwen3-vl-plus | 260K | - | - | chat, vision |
| Dashscope | dashscope/qwen3.5-plus | 992K | - | - | 聊天 |
| Dashscope | dashscope/qwen3-max-2026-01-23 | 258K | - | - | 聊天 |
| Nebius AI | nebius/deepseek-ai/DeepSeek-R1 | 128K | $0.80 | $2.40 | chat, reasoning |
| Nebius AI | nebius/deepseek-ai/DeepSeek-R1-0528 | 164K | $0.80 | $2.40 | chat, reasoning |
| Nebius AI | nebius/deepseek-ai/DeepSeek-V3 | 128K | $0.50 | $1.50 | 聊天 |
| Nebius AI | nebius/deepseek-ai/DeepSeek-V3-0324 | 128K | $0.50 | $1.50 | 聊天 |
| Nebius AI | nebius/deepseek-ai/DeepSeek-R1-Distill-Llama-70B | 128K | $0.25 | $0.75 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen3-235B-A22B | 262K | $0.20 | $0.60 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen3-32B | 32K | $0.10 | $0.30 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen3-30B-A3B | 32K | $0.10 | $0.30 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen3-14B | 32K | $0.08 | $0.24 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen3-4B | 32K | $0.08 | $0.24 | 聊天 |
| Nebius AI | nebius/Qwen/QwQ-32B | 32K | $0.15 | $0.45 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen2.5-72B-Instruct | 128K | $0.13 | $0.40 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen2.5-32B-Instruct | 128K | $0.06 | $0.20 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen2.5-VL-72B-Instruct | 131K | $0.13 | $0.40 | chat, vision |
| Nebius AI | nebius/Qwen/Qwen2-VL-72B-Instruct | 131K | $0.13 | $0.40 | chat, vision |
| Nebius AI | nebius/Qwen/Qwen2-VL-7B-Instruct | 131K | $0.02 | $0.06 | chat, vision |
| Nebius AI | nebius/meta-llama/Meta-Llama-3.1-405B-Instruct | 128K | $1.00 | $3.00 | 聊天 |
| Nebius AI | nebius/meta-llama/Meta-Llama-3.1-70B-Instruct | 128K | $0.13 | $0.40 | 聊天 |
| Nebius AI | nebius/meta-llama/Meta-Llama-3.1-8B-Instruct | 128K | $0.02 | $0.06 | 聊天 |
| Nebius AI | nebius/meta-llama/Llama-3.3-70B-Instruct | 128K | $0.13 | $0.40 | 聊天 |
| Nebius AI | nebius/meta-llama/Llama-Guard-3-8B | 128K | $0.02 | $0.06 | 聊天 |
| Nebius AI | nebius/nvidia/Llama-3.1-Nemotron-Ultra-253B-v1 | 128K | $0.60 | $1.80 | 聊天 |
| Nebius AI | nebius/nvidia/Llama-3.3-Nemotron-Super-49B-v1 | 131K | $0.10 | $0.40 | 聊天 |
| Nebius AI | nebius/NousResearch/Hermes-3-Llama-3.1-405B | 128K | $1.00 | $3.00 | 聊天 |
| Nebius AI | nebius/google/gemma-3-27b-it | 128K | $0.06 | $0.20 | 聊天 |
| Nebius AI | nebius/mistralai/Mistral-Nemo-Instruct-2407 | 128K | $0.04 | $0.12 | 聊天 |
| Nebius AI | nebius/Qwen/Qwen2.5-Coder-7B | 32K | $0.01 | $0.03 | 聊天 |
| Nebius AI | nebius/BAAI/bge-en-icl | 32K | $0.01 | - | 嵌入 |
| Nebius AI | nebius/BAAI/bge-multilingual-gemma2 | 8K | $0.01 | - | 嵌入 |
| Nebius AI | nebius/intfloat/e5-mistral-7b-instruct | 32K | $0.01 | - | 嵌入 |
| AWS Bedrock | mistral.devstral-2-123b | 256K | $0.40 | $2.00 | chat, tools |
| AWS Bedrock | zai.glm-4.7-flash | 200K | $0.07 | $0.40 | chat, tools, reasoning |
| ZAI | zai/glm-5 | 200K | $1.00 | $3.20 | chat, tools, reasoning |
| ZAI | zai/glm-5-code | 200K | $1.20 | $5.00 | chat, tools, reasoning |
| OpenRouter | openrouter/anthropic/claude-sonnet-4.6 | - | - | - | 聊天 |
| OpenRouter | openrouter/google/gemini-3.1-pro-preview | - | - | - | 聊天 |
| OpenRouter | openrouter/openai/gpt-5.1-codex-max | - | - | - | 聊天 |
| OpenRouter | openrouter/qwen/qwen3-coder-plus | - | - | - | 聊天 |
| OpenRouter | openrouter/qwen/qwen3.5-* (5 models) | - | - | - | 聊天 |
| OpenRouter | openrouter/z-ai/glm-5 | - | - | - | 聊天 |
| Together AI | together_ai/Qwen/Qwen3.5-397B-A17B | - | - | - | 聊天 |
| Perplexity | perplexity/pplx-embed-v1-0.6b | 32K | $0.00 | - | 嵌入 |
| Perplexity | perplexity/pplx-embed-v1-4b | 32K | $0.03 | - | 嵌入 |
| Serper | serper/search | - | - | - | 搜尋 |
更新的模型
-
- 將
cache_read_input_token_cost和cache_creation_input_token_cost新增至 Bedrock 託管的 Anthropic 模型(claude-3-opus、claude-3-sonnet、claude-3-haiku,以及 APAC/EU 變體)— 現在會追蹤 prompt caching 以進行成本估算 - 將
apac.anthropic.claude-sonnet-4-6重新命名為au.anthropic.claude-sonnet-4-6,以反映正確的區域識別碼
- 將
-
- 將
supports_none_reasoning_effort新增至所有gpt-5.1-chat、gpt-5.1-codex和gpt-5.4變體(全域、EU、標準部署)— 允許傳入reasoning_effort: null以停用 reasoning
- 將
-
Azure OpenAI — 移除已淘汰的模型
- 移除
azure/gpt-35-turbo-0301(已於 2025-02-13 淘汰) - 移除
azure/gpt-35-turbo-0613(已於 2025-02-13 淘汰)
- 移除
功能
-
- OpenAI 與 Azure 上
gpt-5.4和gpt-5.4-pro的 Day 0 支援
- OpenAI 與 Azure 上
-
- 新增 Gemini 3.x 模型成本對應項目 —
gemini-3-flash-preview、gemini-3.1-pro-preview、gemini-3.1-flash-lite-preview、gemini-3-pro-image-preview、gemini-embedding-2-preview - 將 Gemini 2.0 Flash 和 Flash Lite 重新新增至成本對應(採用更新後的定價)
- 新增 Gemini 3.x 模型成本對應項目 —
-
- 將
gemini-3-flash-preview、gemini-3.1-flash-lite-preview、gemini-flash-experimental和gemini-embedding-2-preview新增至 Vertex AI 模型成本對應
- 將
-
- 新增 Magistral 推理模型 (
magistral-medium-1-2-2509,magistral-small-1-2-2509) - 新增
mistral-large-2512、mistral-medium-3-1-2508、mistral-small-3-2-2506、ministral-3-*變體
- 新增 Magistral 推理模型 (
-
- 新增 Qwen3 VL 多模態模型 (
qwen3-vl-235b,qwen3-vl-32b— instruct 與 thinking 變體) - 新增
qwen3-next-80b-a3b(instruct + thinking)、qwen3.5-plus、qwen3-max-2026-01-23
- 新增 Qwen3 VL 多模態模型 (
-
- 新增 FLUX Kontext 圖像編輯模型 (
flux-kontext-pro,flux-kontext-max) - 新增 FLUX Pro 1.0 Fill(inpainting)與 Expand(outpainting)
- 新增
flux-pro-1.1、flux-pro-1.1-ultra、flux-dev、flux-pro
- 新增 FLUX Kontext 圖像編輯模型 (
-
- 透過 Azure AI Foundry 新增 xAI Grok 模型 (
grok-4-1-fast-non-reasoning,grok-4-1-fast-reasoning) - 新增 Mistral Document AI (
mistral-document-ai-2512) — OCR 模式
- 透過 Azure AI Foundry 新增 xAI Grok 模型 (
-
- 新增
mistral.devstral-2-123b(256K context、工具) - 透過 Bedrock Converse 新增
zai.glm-4.7-flash(200K context、工具、reasoning)
- 新增
-
- 為 SageMaker 上的 Amazon Nova 模型新增
sagemaker_nova提供者 - PR #21542
- 為 SageMaker 上的 Amazon Nova 模型新增
已棄用 / 已移除模型
OpenAI — 從 cost map 移除舊版模型:
gpt-3.5-turbo-0301、gpt-3.5-turbo-0613、gpt-3.5-turbo-16k-0613gpt-4-0314、gpt-4-32k、gpt-4-32k-0314、gpt-4-32k-0613、gpt-4-1106-vision-preview、gpt-4-vision-previewgpt-4.5-preview、gpt-4.5-preview-2025-02-27gpt-4o-audio-preview-2024-10-01、gpt-4o-realtime-preview-2024-10-01o1-mini、o1-mini-2024-09-12、o1-preview、o1-preview-2024-09-12
Google Gemini — 移除 Gemini 1.5 與舊版 2.0 變體:
- 所有
gemini-1.5-*變體(flash、flash-8b、pro,以及附日期版本) gemini-2.0-flash-exp、gemini-2.0-pro-exp-02-05、gemini-2.5-flash-preview-04-17、gemini-2.5-flash-preview-05-20
Google Vertex AI — 移除 PaLM 2 / 舊版模型:
- 所有
chat-bison、text-bison、codechat-bison、code-bison、code-gecko變體 - Gemini 1.0 Pro、1.5 Flash/Pro、2.0 Flash experimental,以及 preview 變體
Perplexity — 移除舊版 Llama-sonar 模型:
llama-3.1-sonar-huge-128k-online、llama-3.1-sonar-large/small-128k-chat/online
LLM API 端點
功能
-
- 在背景串流中處理
response.failed、response.incomplete與response.cancelled終止事件類型 — 先前僅處理response.completed- PR #23492 - Responses API 的 WebSocket 串流支援 — 透過 WebSocket 為所有提供者進行即時串流 - PR #22559, PR #22771
- 用於即時音訊/視訊通訊的 WebRTC 支援 - PR #23446
- OpenAI 相容 JSON 提供者的 Responses API 支援(
openai_like)- PR #21398 - 自動將使用工具與 reasoning 的
gpt-5.4+請求路由至 Responses API - PR #23577
- 在背景串流中處理
-
- 完整支援 Anthropic Files API — 上傳、擷取、列出與刪除檔案;在訊息中使用檔案參照 - PR #16594
-
- Voxtral 音訊轉錄支援 — 透過 Mistral 進行音訊轉錄的
mistral/voxtral-mini-*與mistral/voxtral-*- PR #22801
- Voxtral 音訊轉錄支援 — 透過 Mistral 進行音訊轉錄的
-
- OpenRouter 模型的圖像編輯支援 - PR #22403
-
- Gemini 3 — 當省略
reasoning_effort時,不再注入預設thinking_level(與 Gemini API 一致;Flash 可能預設為high,而非舊的minimal)— Gemini 3 blog
- Gemini 3 — 當省略
-
completion_tokens_details中的 VIDEO 模態 token 使用量追蹤 - PR #22550
-
Images API
- 圖像編輯 API 的
input_fidelity參數 - PR #23201
- 圖像編輯 API 的
-
一般
問題修正
-
- 當 guardrails 將工具轉換為 Anthropic Messages API 格式時,保留原生工具格式(web_search、bash、tool_search 等)- PR #23526
- 在
_map_tool_helper中強制工具輸入 schema 的type: "object"— 修正嚴格 schema 提供者的工具呼叫失敗 - PR #23103 - 依
tool_call_id對tool_result訊息去重 — 防止多輪對話中的重複工具結果錯誤 - PR #23104 - 將
reasoning_effort對應至output_config,用於 Claude 4.6 模型 - PR #22220
-
- 在 Document Intelligence OCR 中從環境變數解析
api_base- PR #21581
- 在 Document Intelligence OCR 中從環境變數解析
-
- 將
extra_headers傳遞至 HuggingFace embedding API - PR #23525
- 將
-
Token 計數/成本
-
工具 / Function Calling
-
一般
- 標準化各提供者之間的
content_filtered結束原因 - PR #23564 - 統一所有提供者的
finish_reason對應為 OpenAI 相容值 - PR #22138 - 修正
/v1/messages與/v1/responses部署上的自訂成本追蹤 - PR #23647 - 修正當
router_model_id沒有定價資料時的每次請求自訂定價——現在會回退至模型名稱 - 修正批次清單在完成後仍顯示過時的
validating狀態 - PR #22982 - 修正當缺少
model_id時,批次擷取回傳原始output_file_id- PR #23194 - 在使用
x-litellm-model標頭時對 batch IDs 進行編碼 - PR #22653 - 在 gpt-oss 提供者的串流 Delta 中將
reasoning對應為reasoning_content- PR #22803
- 標準化各提供者之間的
管理端點 / UI
功能
-
虛擬金鑰
- 在建立/編輯金鑰表單中新增 Organization 下拉選單——
organization_id現在是 Key Ownership 中的一級欄位 - PR #23595 - 允許在
/key/update上設定organization_id——金鑰可在建立後被指派或移至不同的組織 - PR #23557 - 透過 UI 手動重設虛擬金鑰的支出——管理員可依需求將金鑰支出歸零 - PR #22715
- BYOK(Bring Your Own Key)——用戶端提供者 API 金鑰優先於 Anthropic
/v1/messages的代理金鑰 - PR #22964 - 可透過
LITELLM_UI_SESSION_DURATION環境變數設定 UI 登入工作階段持續時間 - PR #22182 - 透過 config.yaml 中的
auto_redirect_ui_login_to_sso: true自動將 UI 登入重新導向至 SSO - PR #23367
- 在建立/編輯金鑰表單中新增 Organization 下拉選單——
-
存取控制(RBAC)
- Organization 管理員現在可存取團隊管理端點——
/team/new、/team/update、/team/delete、/team/member_add、/team/member_delete- PR #23085, PR #23095 - Organization 管理員可檢視並邀請內部使用者——無需全域管理員角色即可進行完整的使用者管理 - PR #23080
- 允許 Admin Viewers 存取 Audit Logs——唯讀管理員角色現在包含稽核記錄存取權 - PR #23419
- 向量儲存與代理程式的 RBAC——為向量儲存與代理程式資源提供金鑰/團隊層級存取控制 - PR #22858
- 使用者篩選範圍(
scope_user_search_to_org)現在改為 opt-in——先前預設開啟,導致非預期的限制 - PR #23057
- Organization 管理員現在可存取團隊管理端點——
-
向量儲存
- 向量儲存管理端點——透過
/v1/vector_stores/*擷取、列出、更新與刪除向量儲存 - PR #23435
- 向量儲存管理端點——透過
-
團隊
-
內部使用者
- 直接從 Internal Users 資訊頁面新增/移除團隊成員資格——包含可搜尋的下拉選單與角色選擇器;不再需要逐一前往各團隊 - PR #23638
-
模型
- 透過 UI 將知識庫附加至模型 - PR #22656
-
預設團隊設定
-
用量
- 自動分頁每日支出資料——所有實體檢視(團隊、組織、客戶、標籤、代理程式、使用者)都會逐頁擷取,圖表會在每一頁後更新 - PR #23622
-
模型 / 成本
- UI 中的 Azure Model Router 成本明細——顯示來自
hidden_params的各子模型additional_costs於CostBreakdownViewer- PR #23550
- UI 中的 Azure Model Router 成本明細——顯示來自
-
使用者管理
- 新的
/user/info/v2端點——相較於現有會導致大型安裝出現記憶體與穩定性問題的 god 端點,這是具範圍限制且支援分頁的替代方案 - PR #23437
- 新的
錯誤修正
- 修正 Tag list 端點因無效的 Prisma
group_bykwargs 而回傳 500 - PR #23606 - 修正 Team Admin 在啟用
scope_user_search_to_org時存取/user/filter/ui會出現 403 - PR #23671 - 修正 Public Model Hub 在儲存後未顯示 config-defined 模型 - PR #23501
- 修正 fallback 彈出視窗模型下拉選單的 z-index 問題 - PR #23516
- 修正 org/team 金鑰限制檢查中對
/key/update的重複計算錯誤 - 修正邀請連結允許同一連結多次重設密碼 - PR #22462
- 修正未設定
duration時未套用金鑰到期預設持續時間 - PR #22956 - 修正所有代理模型在建立金鑰時未包含模型存取群組 - PR #23236
- 修正 admin viewers 無法看見所有組織 - PR #22940
- 修正 Audit Logs UI:新增伺服器端分頁、篩選與抽屜檢視 - PR #22476
- 修正團隊檢視中的虛擬金鑰未正確套用團隊篩選條件 - PR #23065
- 修正團隊到期強制執行驗證 - PR #22728
AI 整合
記錄
-
- 修正失敗路徑 kwargs 不一致導致失敗請求的追蹤被捨棄 - PR #22390
-
- 為 FOCUS 1.2 CSV 匯出新增 Vantage 整合——將 LiteLLM proxy 支出資料匯出為 FinOps Open Cost & Usage Specification 報表,並使用具時間區間的檔名以防止覆寫 - PR #23333
-
一般
- 修正 silent metrics 競態條件,導致實驗之間的 metric 衝突 - PR #23542
防護欄
- 防護欄模式預設清單 — 在未指定每個請求的模式時,設定全域套用的預設防護欄模式清單 - PR #22676
- 基於標籤的防護欄模式清單 — 在基於標籤的防護欄設定中指定模式清單,而非單一模式 - PR #23020
- 修正 presidio PII 權杖外洩 — Presidio 中 Anthropic 處理程序導致權杖回應中 PII 資料外洩的邊界情況 - PR #22627
- 修正 OTEL 孤兒防護欄追蹤 — OpenTelemetry 防護欄追蹤中的 span 重複與回應 ID 遺失 - PR #23001
提示管理
本版本沒有重大提示管理變更。
密鑰管理器
- Hashicorp Vault — 完整的 Hashicorp Vault 整合,作為設定覆寫後端 — 在 Vault 中定義的密鑰會在啟動時擷取並覆寫
config.yaml值。包含管理來自 Vault 的憑證之 UI 支援 - PR #22939, PR #23036
MCP 閘道
功能
- MCP 伺服器的權杖驗證 — 針對每個 MCP 伺服器設定
auth_type: "bearer",讓工具呼叫需要以權杖為基礎的驗證 - PR #23260 - 團隊範圍的 MCP 伺服器篩選 — 在團隊下建立的金鑰只能看到該團隊可用的 MCP 伺服器 - PR #23323
- UI 中的每台伺服器健康重新檢查 — 可對單一 MCP 伺服器觸發健康檢查,而不需重新載入所有伺服器 - PR #23328
錯誤
支出追蹤、預算與速率限制
- 修正與預算連結的金鑰從未重設支出 — 與預算物件連結的金鑰未在設定的重設間隔重設支出 - PR #20688
- 彈性定價支援 — 為提供動態定價層級的提供者在成本對照表中新增
flex_pricing欄位 - PR #22992 - 修正支出記錄清理 — 解決支出記錄清理工作中的鎖定追蹤、整數保留與跳過記錄層級問題 - PR #22687
- 修正 WebSearch 支出記錄去重 — 啟用 thinking 時 WebSearch 攔截失敗;已一併修正支出記錄去重 - PR #22679
- 修正請求沒有 API 金鑰時的 TypeError — 當請求中沒有 API 金鑰時,支出追蹤會拋出未處理的例外 - PR #23363
效能 / 負載平衡 / 可靠性改善
- 修正約 1 小時後的串流當機 —
LLMClientCache._remove_key()不再對已被淘汰的 HTTP/SDK 用戶端呼叫close()/aclose()。在 1 小時 TTL 到期後,進行中的請求會因RuntimeError: Cannot send a request, as the client has been closed.而當機。現在清理僅會在關機時透過close_litellm_async_clients()執行 - PR #22926 - 修正大型安裝上的 OOM / Prisma 連線遺失 — 在具有 336K+ 佇列回應列的執行個體上,無界限的受管理物件輪詢會在約 60~70 分鐘後耗盡 Prisma 連線 - PR #23472
- 集中記錄 kwarg 更新 — 根因修正,將所有記錄更新遷移至單一函式,消除跨記錄路徑的 kwarg 不一致 - PR #23659
- 修正非 root 離線容器的 tiktoken 快取 — tiktoken 快取現在可在以非 root 使用者執行的離線環境中正確運作 - PR #23498
- 當 Redis transaction buffer 沒有 Redis 時阻止 proxy 啟動 — 防止在
use_redis_transaction_buffer: true設定但未連線 Redis 時發生靜默資料遺失 - PR #23019 - 修正
InFlightRequestsMiddleware當機 — middleware 中未定義的 kwargs 會導致請求失敗 - PR #22523 - 修正
BaseModelResponseIterator在非字串串流區塊上的當機 — 當提供者回傳非字串區塊資料時,串流會當機 - PR #23497 - 修正
SERVER_ROOT_PATH前置詞處理 — 在檢查對應的透傳路由前先移除前置詞,以防止雙重前置詞問題 - PR #23414 - 新增 CodSpeed 持續效能基準測試 — 在 CI 上自動追蹤效能回歸 - PR #23676
安全性
- 在 proxy 記錄中遮罩密鑰 — 為所有 LiteLLM 記錄器新增
SecretRedactionFilter,可從記錄訊息、格式化引數、例外回溯與額外欄位中清除 API 金鑰、權杖與憑證。預設啟用;可透過LITELLM_DISABLE_REDACT_SECRETS=true關閉 - PR #23668, PR #23667 - 將 PyJWT 升級至
^2.12.0— 修補^2.10.1的安全漏洞 - PR #23678 - 將
tar升級至 7.5.11,將tornado升級至 6.5.5 — 修補相依套件傳遞依賴中的 CVE - PR #23602
資料庫 / Proxy 作業
- 修正既有執行個體上的 Prisma migrate deploy — 解決遷移復原邏輯中的多個錯誤:P3018 等冪錯誤處理器中缺少 return,以及
_roll_back_migration中未處理的例外,導致即使復原成功後仍出現靜默失敗 - PR #23655 - 讓 DB 遷移失敗退出改為可選 — 預設下 proxy 不再因
prisma migrate deploy失敗而退出;可透過--enforce_prisma_migration_check啟用 - PR #23675
文件更新
- 新增 Anthropic
/v1/messages→/responses參數對應參考 - PR #22893 - 更新 Okta SSO 文件與自訂 SSO handler 範例 - PR #22786
- 在環境變數參考中新增
LITELLM_MAX_BUDGET_PER_SESSION_TTL- PR #23186 - 在
CLAUDE.md中新增 DB 查詢效能指南 - PR #23196 - 新增 Gemini Vertex AI PayGo/priority 成本追蹤文件 - PR #22948
新貢獻者
- @ryanh-ai 在 PR #21542 中完成首次貢獻
- @ryan-crabbe 在 PR #23668 中完成首次貢獻
- @Jah-yee 在 PR #23525 中完成首次貢獻
- @gambletan 在 PR #23516 中完成首次貢獻
- @awais786 在 PR #23183 中完成首次貢獻
- @pradyyadav 在 PR #23580 中完成首次貢獻
- @xianzongxie-stripe 在 PR #23492 中完成首次貢獻
- @Harshit28j 在 PR #23333 中完成首次貢獻
- @codspeed-hq[bot] 在 PR #23676 中完成首次貢獻
差異摘要
03/16/2026
- 新增提供者:7
- 新增模型 / 更新模型:116 個新增、132 個移除
- LLM API 端點:37
- 管理端點 / UI:31
- AI 整合:8
- MCP 閘道:5
- 支出追蹤、預算與速率限制:5
- 效能 / 負載平衡 / 可靠性改善:9
- 安全性:3
- 資料庫 / Proxy 作業:2
- 文件更新:5