跳至主要內容

v1.80.15-stable - Manus API 支援

部署此版本

docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.80.15-stable.1

重點亮點


效能 - 50% 額外負擔降低

LiteLLM 現在透過以 O(1) 字典查找取代依序的 if/elif 鏈來解析提供者設定,使其向 LLM 提供者發送 2.5 倍更多請求(快 92.7%)。這項最佳化影響很大,因為它會在 client decorator 內執行,而該 decorator 會在送往 proxy server 的每個 HTTP request 上被呼叫。

之前

注意: 這裡看起來較差的提供者指標其實是好事——表示請求在 LiteLLM 內停留的時間更少。

============================================================
Fake LLM Provider Stats (When called by LiteLLM)
============================================================
Total Time: 0.56s
Requests/Second: 10746.68

Latency Statistics (seconds):
Mean: 0.2039s
Median (p50): 0.2310s
Min: 0.0323s
Max: 0.3928s
Std Dev: 0.1166s
p95: 0.3574s
p99: 0.3748s

Status Codes:
200: 6000

之後

============================================================
Fake LLM Provider Stats (When called by LiteLLM)
============================================================
Total Time: 1.42s
Requests/Second: 4224.49

Latency Statistics (seconds):
Mean: 0.5300s
Median (p50): 0.5871s
Min: 0.0885s
Max: 1.0482s
Std Dev: 0.3065s
p95: 0.9750s
p99: 1.0444s

Status Codes:
200: 6000

這些基準測試會在本機使用輕量級 LLM 提供者執行 LiteLLM,以消除網路延遲,隔離內部額外負擔與瓶頸,讓我們能專注於在單一執行個體上降低純粹的 LiteLLM 額外負擔。


UI 使用量 - 端點活動

使用者現在可在 UI 中看到端點活動指標。


新提供者與端點

新提供者(11 個新提供者)

提供者支援的 LiteLLM 端點說明
Manus/responses用於 agentic workflows 的 Manus API
ManusGET /responses用於擷取回應的 Manus API
Manus/files用於檔案管理的 Manus API
MiniMax/chat/completionsMiniMax chat completions
MiniMax/audio/speechMiniMax text-to-speech
AWS Polly/audio/speechAWS Polly text-to-speech API
GigaChat/chat/completions適用於俄文 AI 的 GigaChat 提供者
LlamaGate/chat/completionsLlamaGate chat completions
LlamaGate/embeddingsLlamaGate embeddings
Abliteration AI/chat/completionsAbliteration.ai 提供者支援
Bedrock/v1/messages/count_tokens作為 token 計數新提供者的 Bedrock

新的 LLM API 端點(3 個新端點)

端點方法說明文件
/responses/compactPOST精簡回應 API 端點文件
/rag/queryPOSTRAG Search/Query 端點文件
/containers/{id}/filesPOST將檔案上傳至容器文件

新模型 / 更新模型

新模型支援(100+ 個新模型)

提供者模型上下文視窗輸入($/100 萬 tokens)輸出($/100 萬 tokens)功能
Azureazure/gpt-5.2400K$1.75$14.00Reasoning、vision、cache
Azureazure/gpt-5.2-chat128K$1.75$14.00Reasoning、vision
Azureazure/gpt-5.2-pro400K$21.00$168.00Reasoning、vision、web search
Azureazure/gpt-image-1.5-以 token 為基準以 token 為基準圖像生成/編輯
Azure AIazure_ai/gpt-oss-120b131K$0.15$0.60函式呼叫
Azure AIazure_ai/flux.2-pro--$0.04/圖像圖像生成
Azure AIazure_ai/deepseek-v3.2164K$0.58$1.68Reasoning、函式呼叫
Bedrockamazon.nova-2-multimodal-embeddings-v1:08K$0.135-多模態 embeddings
Bedrockwriter.palmyra-x4-v1:0128K$2.50$10.00函式呼叫、PDF
Bedrockwriter.palmyra-x5-v1:01M$0.60$6.00函式呼叫、PDF
Bedrockmoonshot.kimi-k2-v1:0---Kimi K2 model
Cerebrascerebras/zai-glm-4.6128K$2.25$2.75Reasoning、函式呼叫
GigaChatgigachat/GigaChat-2-Lite---聊天回應生成
GigaChatgigachat/GigaChat-2-Max---聊天回應生成
GigaChatgigachat/GigaChat-2-Pro---聊天回應生成
Geminigemini/veo-3.1-generate-001---影片生成
Geminigemini/veo-3.1-fast-generate-001---影片生成
GitHub Copilot25+ models多種--聊天回應生成
LlamaGate15+ models多種--聊天、vision、embeddings
MiniMaxminimax/abab7-chat-preview---聊天回應生成
Novita80+ models多種多種多種聊天、vision、embeddings
OpenRouteropenrouter/google/gemini-3-flash-preview---聊天回應生成
Together AIMultiple models多種多種多種支援 response schema
Vertex AIvertex_ai/zai-glm-4.7---支援 GLM 4.7

功能

  • Gemini
    • 在聊天完成中新增 image tokens - PR #18327
    • 在影像生成中新增 usage 物件 - PR #18328
    • 透過 tool call id 新增 thought signature 支援 - PR #18574
    • 為非 tool call 請求新增 thought signature - PR #18581
    • 保留系統指示 - PR #18585
    • 修正工具回應中的 Gemini 3 影像 - PR #18190
    • 支援 google_search 工具參數使用 snake_case - PR #18451
    • Google GenAI adapter inline data 支援 - PR #18477
    • 為已停用的 Google 模型新增 deprecation_date - PR #18550
  • Vertex AI
    • 新增集中式 get_vertex_base_url() 輔助函式,以支援全域位置 - PR #18410
    • 將影像 URL 轉換為 Vertex AI Anthropic 的 base64 - PR #18497
    • 依 API 規格為每種工具類型分別建立 Tool 物件 - PR #18514
    • 在 VertexGeminiConfig 新增 thought_signatures - PR #18853
    • 新增對 Vertex AI API 金鑰的支援 - PR #18806
    • 新增 zai glm-4.7 模型支援 - PR #18782
  • Azure
    • 將 Azure gpt-image-1.5 定價新增至成本對照表 - PR #18347
    • 新增 azure/gpt-5.2-chat 模型 - PR #18361
    • 新增透過 Azure AD token 進行影像生成的支援 - PR #18413
    • 新增 Azure OpenAI GPT-5.2 模型的 logprobs 支援 - PR #18856
    • 新增 Azure BFL Flux 2 模型,用於影像生成與編輯 - PR #18764, PR #18766
  • Bedrock
    • 新增 Bedrock Kimi K2 模型支援 - PR #18797
    • 在 bedrock passthrough 中新增對 model id 的支援 - PR #18800
    • 修正 Bedrock 提供者的 Nova 模型偵測 - PR #18250
    • 在從 OpenAI 格式轉換時,確保 toolUse.input 一律為 dict - PR #18414
  • Databricks
    • 新增強化的驗證、安全功能,以及自訂 user-agent 支援 - PR #18349
  • MiniMax
    • 新增 MiniMax 聊天完成支援 - PR #18380
    • 新增 MiniMax 的 Anthropic 原生端點支援 - PR #18377
    • 新增 MiniMax TTS 支援 - PR #18334
    • 在 UI 儀表板新增 MiniMax 提供者支援 - PR #18496
  • Together AI
    • 將 supports_response_schema 新增至所有支援的 Together AI 模型 - PR #18368
  • OpenRouter
    • 新增 OpenRouter embeddings API 支援 - PR #18391
  • Anthropic
    • 傳遞 server_tool_use 與 tool_search_tool_result 區塊 - PR #18770
    • 為影像工具呼叫結果新增 Anthropic 快取控制選項 - PR #18674
  • Ollama
    • 為 ollama embedding 新增 dimensions - PR #18536
    • 從 Ollama 的 data URLs 擷取純 base64 資料 - PR #18465
  • Watsonx
    • 新增 Watsonx fields 支援 - PR #18569
    • 修正 Watsonx Audio Transcription - filter model field - PR #18810
  • SAP
    • 在 proxy UI 中為 list 新增 SAP creds - PR #18375
    • 傳遞 allowed_openai_params 中的額外參數 - PR #18432
    • 為 SAP AI Core Tracking 新增 client header - PR #18714
  • Fireworks AI
  • ZAI
    • 新增具推理支援的 GLM-4.7 模型 - PR #18476
  • Codestral
    • 正確路由 codestral chat 與 FIM 端點 - PR #18467
  • Azure AI
    • 修正透過 azure_ai 存取 messages API 時的驗證錯誤 - PR #18500

新的提供者支援

錯誤修正

  • Gemini
    • 正確攔截超出 context window 的錯誤 - PR #18283
    • 移除 prompt caching 標頭,因為支援已移除 - PR #18579
    • 修正含音訊檔案 id 的 generate content 請求 - PR #18745
    • 修正 google_genai streaming adapter 的提供者處理 - PR #18845
  • Groq
    • 移除已棄用的 Groq 模型並更新模型登錄 - PR #18062
  • Vertex AI
    • 處理 Vertex AI count tokens 端點不支援的區域 - PR #18665
  • 一般
    • 修正影像 embedding 請求的 request body - PR #18336
    • 修正在串流同時包含文字與 tool_calls 時遺失 tool_calls 的問題 - PR #18316
    • 為 gpt-image-1.5 新增 all resolution - PR #18586
    • 修正使用 token-based pricing 計算 gpt-image-1 成本 - PR #17906
    • 修正 response_format 滲漏至 extra_body - PR #18859
    • 將 max_tokens 與 max_output_tokens 對齊以保持一致性 - PR #18820

LLM API 端點

功能

錯誤

  • 一般
    • 處理回應轉換中的空錯誤物件 - PR #18493
    • 在串流模式中保留用戶端錯誤狀態碼 - PR #18698
    • 初始串流錯誤時回傳 json 錯誤回應,而非 SSE 格式 - PR #18757
    • 修正 generateContent 請求中自訂 api base 的驗證標頭 - PR #18637
    • Tool 內容對 Deepinfra 應為字串 - PR #18739
    • 修正傳入的回應物件中不完整的用量資訊 - PR #18799
    • 將模型名稱統一為提供者定義的名稱 - PR #18573

管理端點 / UI

功能

  • SSO 組態
    • 新增 SSO 角色對應功能 - PR #18090
    • 新增 SSO 設定頁面 - PR #18600
    • 允許新增 SSO 的角色對應 - PR #18593
    • SSO 設定頁面新增角色對應 - PR #18677
    • SSO 設定載入狀態 + 淘汰舊版 SSO 流程 - PR #18617
  • 虛擬金鑰
    • 允許刪除金鑰到期時間 - PR #18278
    • 為 /key/list 新增可選查詢參數 "expand" - PR #18502
    • 金鑰表格載入骨架 - PR #18527
    • 允許調整金鑰表格欄寬 - PR #18424
    • 虛擬金鑰表格跨頁載入狀態 - PR #18619
    • 金鑰與團隊路由設定 - PR #18790
    • 允許在金鑰與團隊中使用 router_settings - PR #18675
    • 使用 timedelta 在 generate 時計算金鑰到期時間 - PR #18666
  • 模型 + 端點
    • 為團隊管理員新增模型清除流程 - PR #18532
    • 模型頁面載入狀態 - PR #18574
    • 模型頁面模型提供者選擇效能 - PR #18425
    • 模型頁面排序會排序整個集合 - PR #18420
    • 重構模型中樞頁面 - PR #18568
    • 在 UI 上新增請求提供者表單 - PR #18704
  • 組織與團隊
    • 允許組織管理員查看組織分頁 - PR #18400
    • 在團隊表格中解析組織別名 - PR #18401
    • 在組織資訊檢視中解析團隊別名 - PR #18404
    • 允許組織管理員查看其組織資訊 - PR #18417
    • 允許在 /team/update 中編輯 team_member_budget_duration - PR #18735
    • 可重複使用的 Duration 選擇器 + 團隊更新成員預算期間 - PR #18736
  • 用量與支出
    • 在支出記錄上新增錯誤代碼篩選 - PR #18359
    • 在 UI 上新增錯誤代碼篩選 - PR #18366
    • 用量頁面使用者最大預算修正 - PR #18555
    • 為 Daily Activity Tables 新增端點 - PR #18729
    • 用量中的端點活動 - PR #18798
  • 成本估算器
    • 為 AI Gateway 新增成本估算器 - PR #18643
    • 新增跨請求估算成本的檢視 - PR #18645
    • 允許在成本估算器中選取多個模型 - PR #18653
  • CloudZero
    • 改善 CloudZero 的建立與刪除路徑 - PR #18263
    • 新增 CloudZero UI 文件 - PR #18350
  • Playground
    • 在 Playground 的 completions 新增 MCP 測試支援 - PR #18440
    • 為 playground 新增可選取的 MCP servers - PR #18578
    • 為 Playground 新增自訂 proxy base URL 支援 - PR #18661
  • 一般 UI
    • UI 樣式改進與修正 - PR #18310
    • 為功能亮點新增可重複使用的「新增」徽章元件 - PR #18537
    • 隱藏新增徽章 - PR #18547
    • 將預算頁面改為分頁 - PR #18576
    • 點擊標誌會導向正確的 URL - PR #18575
    • 新增設定 meta URLs 的 UI 支援 - PR #18580
    • 登入時使先前的 UI 工作階段權杖失效 - PR #18557
    • 新增授權端點 - PR #18311
    • Router Fields 端點 + Router Fields 的 React Query - PR #18880

錯誤

  • UI 修正
    • 修正金鑰建立 MCP 設定表單意外送出 - PR #18355
    • 修正開發環境中 UI 消失 - PR #18399
    • 修正停用管理 UI 標記 - PR #18397
    • 從模型頁面移除模型分析 - PR #18552
    • 新增連結時從實用連結移除對話框 - PR #18602
    • SSO 編輯對話框在提供者變更時清除角色對應值 - PR #18680
    • UI 登入大小寫敏感性修正 - PR #18877
  • API 修正
    • 修正使用者邀請與金鑰產生電子郵件通知邏輯 - PR #18524
    • 標準化 Proxy Config 回呼 - PR #18775
    • 在未設定模型時回傳空資料陣列,而非 500 - PR #18556
    • 強制執行組織層級最大預算 - PR #18813

AI 整合

新整合(4 個新整合)

整合類型說明
Focus記錄支援 Focus 匯出以供可觀測性使用 - PR #18802
SigNoz記錄SigNoz 用於可觀測性的整合 - PR #18726
Qualifire防護欄Qualifire 防護欄與評估 webhook - PR #18594
Levo AI防護欄Levo AI 用於安全性的整合 - PR #18529

記錄

防護欄


支出追蹤、預算與速率限制

  • Platform Fee / Margins - 新增對 Platform Fee / Margins 的支援 - PR #18427
  • 負預算驗證 - 新增負預算驗證 - PR #18583
  • 成本計算修正
    • 修正 reasoning_tokens 在沒有 text_tokens 時的成本計算 - PR #18607
    • 修正背景成本追蹤測試 - PR #18588
  • 標籤路由 - 支援在 ANY 與 ALL 之間切換標籤比對 - PR #18776

MCP 閘道

  • MCP 全域模式 - 新增 MCP 全域模式 - PR #18639
  • MCP 伺服器可見性 - 新增可設定的 MCP 伺服器可見性 - PR #18681
  • MCP 登錄 - 新增 MCP 登錄 - PR #18850
  • MCP Stdio 標頭 - 支援 MCP stdio 標頭環境變數覆寫 - PR #18324
  • 平行工具擷取 - 來自多個 MCP 伺服器的工具擷取平行化 - PR #18627
  • 最佳化 MCP 伺服器列表 - 為最佳化列表分離健康檢查 - PR #18530
  • 驗證改進
    • MCP 連線測試端點需要驗證 - PR #18290
    • 修正 MCP 閘道 OAuth2 驗證問題與 ClosedResourceError - PR #18281
  • 錯誤修正
    • 修正 MCP 伺服器健康狀態回報 - PR #18443
    • 修正 OpenAPI 到 MCP 工具的轉換 - PR #18597
    • 移除 exec() 使用並為安全性處理無效的 OpenAPI 參數名稱 - PR #18480
    • 修正在同時使用多個伺服器時的 MCP 錯誤 - PR #18855
  • 將 MCP 擷取邏輯遷移至 React Query - PR #18352

效能 / 負載平衡 / 可靠性改善

  • 92.7% 更快的提供者設定查找 - LiteLLM 現在對 LLM 提供者施加 2.5 倍壓力 - PR #18867
  • 延遲載入改善
    • 以註冊表模式整併延遲匯入處理器 - PR #18389
    • 完成所有 180+ 個 LLM 設定類別的延遲載入遷移 - PR #18392
    • 延遲載入其他元件(類型、回呼、公用程式) - PR #18396
    • 為 get_llm_provider 新增延遲載入 - PR #18591
    • 延遲載入大型音訊函式庫與記錄器 - PR #18592
    • 在 litellm/utils.py 中延遲載入 9 個大型匯入 - PR #18595
    • 延遲載入大型匯入以改善匯入時間與記憶體使用 - PR #18610
    • 為提供者設定、模型資訊類別、串流處理器實作延遲載入 - PR #18611
    • 延遲載入 15 個額外匯入 - PR #18613
    • 延遲載入 15+ 個未使用匯入 - PR #18616
    • 延遲載入 DatadogLLMObsInitParams - PR #18658
    • 將 utils.py 的延遲匯入遷移至註冊表模式 - PR #18657
    • 延遲載入 get_llm_provider 與 remove_index_from_tool_calls - PR #18608
  • 路由器改善
    • 在啟動時驗證 routing_strategy,以在發生錯誤時快速失敗並提供有幫助的錯誤訊息 - PR #18624
    • 修正重試邏輯中的 num_retries 追蹤 - PR #18712
    • 改善具有多重憑證的萬用字元路由之錯誤訊息與驗證 - PR #18629
  • 記憶體改善
    • 新增記憶體模式偵測測試並修正不良記憶體模式 - PR #18589
    • 在記憶體測試中新增無界資料結構偵測 - PR #18590
    • 新增具 CI 整合的記憶體洩漏偵測測試 - PR #18881
  • 資料庫
    • 為 LOWER(user_email) 新增 idx,以加快重複電子郵件檢查 - PR #18828
    • 預先刷新 RDS IAM token,以防止 15 分鐘連線失敗 - PR #18795
    • 說明 database_connection_pool_limit 是按每個 worker 套用 - PR #18780
    • 使 base_connection_pool_limit 預設值保持相同 - PR #18721
  • Docker
    • 為資料庫 Docker 映像檔新增 libsndfile,以進行音訊處理 - PR #18612
    • 新增 line_profiler 支援以進行效能分析並修正 Windows CRLF 問題 - PR #18773
  • Helm
    • 為 Helm charts 新增生命週期支援 - PR #18517
  • 驗證
    • 新增 Kubernetes ServiceAccount JWT 驗證支援 - PR #18055
    • 使用 async anthropic client 以避免事件迴圈阻塞 - PR #18435
  • 記錄工作者
    • 在 multiprocessing 中處理事件迴圈變更 - PR #18423
  • 安全性
    • 防止逾期金鑰明文洩漏於錯誤回應中 - PR #18860
    • 在模型資訊中遮罩額外標頭密鑰 - PR #18822
    • 防止 request_tags 中重複的 User-Agent 標籤 - PR #18723
    • 正確使用 litellm api keys - PR #18832
  • 其他
    • 移除 main.py 中的重複匯入 - PR #18406
    • 新增 LITELLM_DISABLE_LAZY_LOADING 環境變數以修正 VCR cassette 建立問題 - PR #18725
    • 將 xiaomi_mimo 新增至 LlmProviders enum 以修正路由器支援 - PR #18819
    • 允許在舊版 Python 上使用目前的 grpcio 進行安裝 - PR #18473
    • 為 boto3 clients 新增自訂 CA 憑證 - PR #18852
    • 修正 bedrock_cache、metadata 與 max_model_budget - PR #18872
    • 修正 LiteLLM SDK embeddings 標頭缺少欄位 - PR #18844
    • 將自動 reasoning 摘要包含功能置於 feat flag 之後 - PR #18688
    • turn_off_message_logging 不會在 proxy_server_request 欄位中遮蔽 request messages - PR #18897

文件更新

  • 提供者文件
    • 將 MiniMax 文件更新為正確格式 - PR #18403
    • 新增 5 個 AI 提供者的文件 - PR #18388
    • 修正 gpt-5-mini 的 reasoning_effort 支援值 - PR #18346
    • 修正 Anthropic 頁面中的 PDF 文件不一致問題 - PR #18816
    • 更新 OpenRouter 文件以包含 embedding 支援 - PR #18874
    • 在文件中新增 LITELLM_REASONING_AUTO_SUMMARY - PR #18705
  • MCP 文件
  • 防護欄文件
  • 基礎架構文件
    • IAM Roles Anywhere 文件 - PR #18559
    • 修正 proxy 設定文件中的格式 - PR #18498
    • 修正 proxy 模式缺少 GCS 快取文件的問題 - PR #13328
    • 修正如何執行 cloudzero sql - PR #18841
  • 一般
    • LiteLLM 採用者區段 - PR #18605
    • 移除關於設定 litellm.callbacks 的多餘註解 - PR #18711
    • 透過移除空格,將標題更新為 Markdown 粗體 - PR #18846
    • Manus 文件 - 新提供者 - PR #18817

新增貢獻者


完整變更紀錄

在 GitHub 上查看完整變更紀錄