跳至主要內容

v1.83.10 - Claude Opus 4.7、Prompt Compression 與 Multi-Window Budgets

部署此版本

docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:main-v1.83.10-stable

主要亮點


破壞性變更

除非 key/team 選擇加入,否則呼叫端提供的 tags 會被移除

  • 變更內容: 由呼叫端提供的標籤 — metadata.tagslitellm_metadata.tags、根層級 tags,以及 x-litellm-tags header — 會在 基於標籤的路由基於標籤的支出歸屬 執行前,從請求中移除,除非呼叫用 key 或其父層 team 帶有 metadata.allow_client_tags: true。在模型部署、key 中繼資料或 team 中繼資料上設定的標籤不受影響。每次移除時,proxy 都會記錄一行 WARNING

    Stripped caller-supplied tags from metadata, tags (root): this key/team does not have `allow_client_tags: true` in its metadata. Set it to opt into client-supplied routing/budget tags.

    PR #25905

  • 受影響對象: 任何仰賴用戶端在請求本文或 x-litellm-tags header 中傳入 tags,以進行基於標籤的成本追蹤、標籤預算或基於標籤路由的部署。升級後,這些標籤將靜默落入預設 bucket / 預設部署,而依標籤的支出報告將顯示為空白。

  • 恢復先前行為: 在受影響 key(或其所屬 team)的中繼資料中設定 allow_client_tags: true。任一旗標即可生效——只要該 key 或其父層 team 帶有此旗標,呼叫端提供的標籤就會通過。

    # Per key
    curl -L -X POST 'http://0.0.0.0:4000/key/generate' \
    -H 'Authorization: Bearer sk-1234' \
    -H 'Content-Type: application/json' \
    -d '{"metadata": {"allow_client_tags": true}}'

    # Per team
    curl -L -X POST 'http://0.0.0.0:4000/team/new' \
    -H 'Authorization: Bearer sk-1234' \
    -H 'Content-Type: application/json' \
    -d '{"metadata": {"allow_client_tags": true}}'

    既有的 key/team 可透過 /key/update/team/update 進行修補,並帶入相同的 metadata payload。

UI 或 API 中的 os.environ/…

  • 變更內容:os.environ/OPENAI_API_KEY(以及其他 os.environ/… 模式)這類值,當它們來自請求提供的欄位時,不再展開——包含 Admin UI 以及 UI 所呼叫的相同 proxy APIs。— PR #25592

  • 受影響對象: 任何在 UI 或 API 中輸入字面上的 os.environ/SECRET_NAME 字串,並預期 proxy 在執行時以主機環境變數代入的人。

  • 替代做法: 提供者 API 金鑰與類似機密應使用 Reusable Credentials 儲存,並附加至模型(例如透過 litellm_credential_name)。對於可觀測性回呼(Langfuse、LangSmith 等),請將 key 與 endpoint 設定在 proxy config.yaml 中,或設定在程序在啟動時讀取的環境變數中——不要作為每個請求中中繼資料內的 os.environ/… 字串。


新模型 / 更新模型

新模型支援(10 個新模型)

提供者模型上下文視窗輸入($/百萬 tokens)輸出($/百萬 tokens)功能
Anthropicclaude-opus-4-7, claude-opus-4-7-202604161M$5.00$25.00Chat、reasoning、vision、computer use、prompt caching、PDF input、xhigh reasoning effort
AWS Bedrockanthropic.claude-opus-4-7, us.anthropic.claude-opus-4-7, eu.anthropic.claude-opus-4-7, au.anthropic.claude-opus-4-7, global.anthropic.claude-opus-4-71M$5.50$27.50Chat、reasoning、vision、computer use、prompt caching、PDF input、native structured output
Vertex AIvertex_ai/claude-opus-4-7, vertex_ai/claude-opus-4-7@default1M$5.00$25.00Chat、reasoning、vision、computer use、prompt caching、PDF input
Azure AIazure_ai/claude-opus-4-7200K$5.00$25.00Chat、reasoning、vision、computer use、prompt caching、PDF input
Perplexityperplexity/anthropic/claude-opus-4-7---Web search、function calling(Responses mode)
Google Geminigemini/veo-3.1-lite-generate-preview1024-$0.05 / sec影片生成預覽
OpenRouteropenrouter/google/gemini-3.1-flash-lite-preview1.05M$0.25$1.50Chat、code execution、file search、function calling、prompt caching、reasoning、web search、vision、video/audio/PDF input
xAIxai/grok-4.20-0309-reasoning2M$2.00$6.00Function calling、reasoning、tool choice、vision、web search
W&B Inferencewandb/MiniMaxAI/MiniMax-M2.5197K$0.30$1.20Function calling、reasoning、response schema
W&B Inferencewandb/moonshotai/Kimi-K2.5262K$0.60$3.00Function calling、reasoning、response schema、vision

功能

  • Anthropic

    • Claude Opus 4.7 於 Anthropic native、Bedrock、Vertex AI、Azure AI 與 Perplexity 的首日支援 - PR #25867
    • Opus 4.7 routing/version-string 處理的 hotfix 後續修正 - PR #25875PR #25876
    • 在無效 thinking signature 錯誤後重試 /v1/messages - PR #25674
  • AWS Bedrock

    • 標準化 Invoke 與 Converse APIs 的自訂工具 JSON schema - PR #25396
    • Bedrock API 回應 null 型別處理 - PR #25810PR #24147
    • 防止僅起始快取使用產生負的串流成本 - PR #25846
    • 在 UI 與 SpendLogs 中準確顯示快取 token 成本拆分 - PR #25735
    • 移除 Bedrock 測試檔案中未解決的合併衝突標記 - PR #25995
    • 以請求本文 mock 取代不穩定的 Bedrock gpt-oss tool-call live test - PR #25739
    • Mock Bedrock Moonshot tests + 修正 TogetherAIConfig 遞迴 - PR #25920
    • 移除已無作用的 Bedrock clear_thinking interleaved-thinking-beta 斷言 - PR #25913
  • Google Vertex AI

    • 透過 map_finish_reason 標準化 Gemini finish_reason enum - PR #25337
    • vertex_ai/qwen3-235b-a22b-instruct-2507-maas 新增 us-south1 區域 - PR #25382
    • 新增 vertex_ai/claude-opus-4-7vertex_ai/claude-opus-4-7@default 成本對映項目 - 成本對映
  • Google Gemini

    • Veo 3.1 Lite 的定價、影片解析度用量,以及分級成本追蹤 - PR #25348
  • Azure AI

    • 新增 azure_ai/claude-opus-4-7 成本對應條目 - 成本對應
    • 透過 logging hook 為 Azure passthrough 填入 standard_logging_object - PR #25679
  • OpenAI

    • 省略 OpenAI embedding 請求中的空值 encoding_format - PR #25395(之後在 PR #25698 中回復 — 請見 Bug Fixes)
  • xAI

    • 新增 xai/grok-4.20-0309-reasoning 成本對應條目 - PR #25930
  • Together AI

    • get_model_info 中公開 reasoning effort 欄位,並新增 together_ai/gpt-oss-120b - PR #25263
    • 在測試中以無伺服器的 Qwen3.5-9B 取代已淘汰的 Mixtral - PR #25728
  • DashScope

    • 為明確的 prompt caching 保留 cache_control - PR #25331
  • GitHub Copilot

    • 允許覆寫預設的 GitHub Copilot 驗證端點 - PR #25915
  • W&B Inference

    • 新增 Kimi-K2.5 和 MiniMax-M2.5 成本對應條目 - PR #25409

Bug 修正

  • Anthropic

    • 回傳來自 /v1/messages/count_tokens 的實際上游狀態碼,而非一律 200 - PR #21352
  • Vertex AI

    • Gemini finish_reason enum 正規化(請見上方 Features)- PR #25337
  • Embeddings API

    • 在下游回歸之後,回復對空值 encoding_format 的省略 - PR #25698
  • 一般

    • 修正文件橫幅中顯示的 version - PR #25875

LLM API 端點

功能

錯誤

  • 一般
    • 在憑證驗證中收緊 api_key 值檢查 - PR #25917
    • 收緊請求參數中的環境參照處理 - PR #25592
    • 強化請求參數處理 - PR #25827
    • 新增共用路徑工具並防止目錄遍歷 - PR #25834
    • 為使用者提供的 URL 新增 URL 驗證 - PR #25906
    • 從管理中繼資料讀取 guardrail 設定;修正標籤路由一致性 - PR #25905
    • 在管理操作中強制執行組織邊界 - PR #25904
    • 解決 prometheus_helpers 檔案/套件遮蔽,避免破壞 /global/spend/logs - PR #26026
    • 強化 CORS 憑證、create_views 例外處理,以及 spend-log 清理迴圈 - PR #25559
    • 防止 API 金鑰外洩於錯誤追蹤回溯、記錄與警示中 - PR #25117
    • 移除 license public_key.pem 前導空白 - PR #25339
    • 快取失效:停止在大量更新與金鑰輪替中對 token 進行雙重雜湊 - PR #25552
    • model_max_budget 對已路由模型靜默失效 - PR #25549
    • 升級 25 個由 dependabot 回報的脆弱相依套件中的 22 個 - PR #25442
    • 修正 multiple valuesTypeError 中的 get_cache_key - PR #20261
    • S3v2:對 SigV4 簽署的 S3 請求使用已準備好的 URL - PR #25074
    • 健康檢查 reasoning-token 與 max-token 的優先順序 - PR #25936
    • BACKGROUND_HEALTH_CHECK_MAX_TOKENS 環境變數 - PR #25344
    • 批次限制過時的受管理物件清理,以避免 30 萬列 UPDATE - PR #25227
    • 保留 StandardLoggingPayload 中的提供者回應標頭 - PR #25807
    • 最佳化 DB 查詢,以防健康檢查期間發生 OOM - PR #25732
    • PodLockManager.release_lock 原子式 compare-and-delete(重新納入 #21226)- PR #24466
    • routing_strategy_args 在策略不是基於延遲時回傳 None - PR #25882
    • is_tool_name_prefixed 針對已知 MCP 伺服器前綴進行驗證 - PR #25085
    • 在重新啟動之間保留預設 router 終止預算 - PR #25991
    • 在 team 範圍的金鑰管理檢查中強制執行團隊成員資格 - PR #25686
    • 代理程式端點與路由權限檢查 - PR #25922
    • Prometheus metrics 的 JWT 驗證 key_alias=user_id — 初始修正與回復 - PR #25340, PR #25438
    • 將 post-custom-auth DB 查詢設為需 opt-in 的旗標後才執行 - PR #25634
    • 對齊使用者與金鑰更新端點中的欄位層級檢查 - PR #25541
    • 與使用者範圍一致的 /spend/logs 篩選處理 - PR #25594
    • 以 RestrictedPython 取代 custom_code guardrail 沙箱 - PR #25818
    • Presidio:在 anonymize_text 中使用正確的文字位置 - PR #24998

管理端點 / UI

功能

  • 虛擬金鑰

    • 可設定多門檻預算警示(例如 50% / 80% / 95%)- PR #25989
    • 每個 API 金鑰與團隊可同時存在多個預算視窗(#24883)- PR #25109
    • 每成員模型範圍 + 團隊 default_team_member_models - PR #24950
    • 將重新產生金鑰的 modal 移轉至 AntD - PR #25406
    • 從金鑰更新負載中移除空白的 premium 欄位 - PR #26023
    • 預設邀請使用者 modal 的全域角色為最小權限 - PR #25721
  • 團隊

    • 允許在建立團隊後編輯路由設定 - PR #25398
    • 針對特定全域防護欄提供每個團隊的退出選項 - PR #25575
    • 已刪除的金鑰/團隊顯示企業提示橫幅 - PR #25814
    • 在團隊變更後使組織查詢失效 - PR #25812
    • 編輯團隊模型 TPM/RPM 限制的 E2E 測試 - PR #25658
  • 模型 + 端點

    • UI 設定中支援 Claude Code BYOK - PR #25998
    • Add Model 流程的 E2E 測試 - PR #25590
    • 為布林值防護欄提供者欄位預先選取後端預設值 - PR #25700
    • Select 中呈現防護欄 optional_params 布林預設值 - PR #25806
    • MCP ToolTestPanel 布林輸入改用 AntD Select - PR #25809
    • 在 MCP 伺服器編輯時保留 extra_headers - PR #26003
    • 將 Guardrail Test Playground 從 @tremor/react 移轉到 AntD - PR #25749
    • 將 router_settings 頁面從 Tremor 移轉到 AntD - PR #25879
    • 減少 Guardrails Monitor 版面配置中的 Tremor 使用量 - PR #25803
    • 從 Swagger 文件訊息中移除 Chat UI 連結 - PR #25727
    • 透過受控對話框刪除 policy 附件 - PR #25324
  • 驗證 / SSO

    • 解決反向代理將 HttpOnly 加入 cookie 時的登入重新導向迴圈 - PR #23532
    • 將自訂驗證後的資料庫查詢置於 opt-in 標記之後 - PR #25634
  • 記錄 / 活動

    • 將 logs 團隊篩選下拉選單與根層級 teams 狀態隔離,避免狀態外洩 - PR #25716
    • /spend/logs 篩選處理與使用者範圍一致化 - PR #25594
  • Helm

    • tpl 支援加入 extraContainersextraInitContainers - PR #25494

錯誤

  • 從金鑰更新負載中移除空的 premium 欄位 - PR #26023
  • 收緊憑證驗證中的 api_key 值檢查 - PR #25917
  • extra_headers 未在 MCP 伺服器編輯時持久化 - PR #26003
  • logs 團隊篩選下拉選單外洩 - PR #25716
  • user_dashboard 測試中的 cookieUtils 模擬物件加入 getCookie - PR #25719
  • 移除已棄用的 tests/ui_e2e_tests/ 測試套件 - PR #25657
  • 限制 x-pass- 標頭轉送 - PR #25916
  • Blog 深色模式文字在深色背景上無法顯示 - PR #25620
  • 預設邀請使用者角色為最小權限 - PR #25721

AI 整合

記錄

  • Prometheus

    • 新增 7m 和 10m 延遲 histogram bucket - PR #25071
    • Prometheus exporter 的效能改善 - PR #25934
    • 解決 prometheus_helpers 檔案/套件 shadow 導致 /global/spend/logs 中斷 - PR #26026
  • Azure Pass-Through

    • 透過 logging hook 填入 standard_logging_object - PR #25679
  • 一般

    • StandardLoggingPayload 中保留提供者回應標頭 - PR #25807

防護欄

  • PromptGuard

    • 用於提示注入偵測的新 PromptGuard 防護欄整合 - PR #24268
  • 自訂程式碼防護欄

    • custom_code sandbox 取代為 RestrictedPython - PR #25818
  • Presidio

    • anonymize_text 中使用正確的文字位置 - PR #24998
  • 一般

    • 針對特定全域防護欄提供每個團隊的退出選項 - PR #25575
    • UI:為布林值防護欄提供者欄位預先選取後端預設值 - PR #25700
    • UI:在 Select 中呈現防護欄 optional_params 布林預設值 - PR #25806
    • 從管理員中繼資料讀取防護欄設定,並修正標籤路由一致性 - PR #25905

快取

  • 將 Responses API 參數加入快取金鑰允許清單 - PR #25673
  • 防止 multiple values TypeErrorget_cache_key 中發生 - PR #20261
  • S3v2:對 SigV4 簽章的 S3 請求使用已準備的 URL - PR #25074

提示管理 / 壓縮

密鑰管理器

  • 此版本沒有新增密鑰管理器提供者。

支出追蹤、預算與速率限制

  • 虛擬金鑰可設定多門檻預算警示(例如 50% / 80% / 95%) - PR #25989
  • API 金鑰與團隊的多個並行預算視窗(#24883) - PR #25109
  • Bedrock/Anthropic 在 UI 與 SpendLogs 中的快取 token 成本明細更精確 - PR #25735
  • Bedrock:防止僅起始快取用量產生負值串流成本 - PR #25846
  • 修正虛擬金鑰預估支出軟性預算警示 - PR #25838
  • 在並行請求限制器中強制執行專案層級、模型特定的速率限制 - PR #25994
  • 重新啟動後保留預設路由器 end-budget - PR #25991
  • 將舊版實體(Team Members、End Users)的重設時間與標準化行事曆對齊 - PR #25440
  • 批次限制過期 managed-object 清理,以避免 30 萬列 UPDATE - PR #25227
  • 快取失效:停止在批次更新與金鑰輪替中對 token 進行雙重雜湊 - PR #25552
  • model_max_budget 對已路由模型悄然失效 - PR #25549
  • get_model_info 中公開 reasoning-effort 欄位(並將 together_ai/gpt-oss-120b 加入成本對照表) - PR #25263
  • Veo 3.1 Lite 具解析度感知的分級成本追蹤 - PR #25348
  • 為 Vertex qwen3-235b-a22b-instruct-2507-maas 成本對照表新增 us-south1 區域 - PR #25382

MCP 閘道

  • 根據已知 MCP server 前綴集合驗證 is_tool_name_prefixed - PR #25085
  • 在未儲存的每位使用者 token 不存在時,恢復觸發 PKCE 的 401 - PR #26032
  • 從 MCP 閘道公開每個伺服器的 InitializeResult.instructions - PR #25694
  • 將共用 PKCE 輔助函式抽出至 utils/pkce.ts - PR #25878
  • UI:MCP ToolTestPanel 布林輸入改用 AntD Select - PR #25809
  • UI:在 MCP 伺服器編輯時保留 extra_headers - PR #26003

效能 / 負載平衡 / 可靠性改善

  • Prometheus 匯出器效能改善 - PR #25934
  • 最佳化 DB 查詢以防止健康檢查期間發生 OOM - PR #25732
  • PodLockManager.release_lock 原子比較並刪除(#21226 的重新上線) - PR #24466
  • 健康檢查 reasoning-token max-token 優先順序 - PR #25936
  • 新的 BACKGROUND_HEALTH_CHECK_MAX_TOKENS 環境變數 - PR #25344
  • 當策略不是以延遲為基礎時,回傳 Nonerouting_strategy_args - PR #25882
  • 提升 proxy 相依性;將最低 Python 版本提高至 3.10 - PR #26022
  • 升級 25 個由 dependabot 回報的脆弱相依性中的 22 個 - PR #25442
  • 將 packaging、CI 與 Docker 從 Poetry 遷移至 uv - PR #25007
  • [Infra]llm_translation_testing 資源類別提升至 xlarge,並容忍 worker 重新啟動 - PR #25887, PR #25898
  • [Infra] 擴充非 main PR 目標的 CI 分支篩選條件 - PR #25819
  • [Infra] 限制 main 只接受來自 staging 與 hotfix 分支的 PR - PR #25733
  • [Infra] 從 CircleCI 設定中移除未使用的 publish_proxy_extrasprisma_schema_sync 工作 - PR #25821
  • fix(ci):將 test-server-root-path 逾時時間提高至 30m - PR #25741
  • 從 coverage combine 中移除不存在的 litellm_mcps_tests_coverage - PR #25737
  • Helm:為 extraContainers / extraInitContainers 新增 tpl 支援 - PR #25494
  • 非 Anthropic 提供者的 Advisor 工具協調迴圈 - PR #25579

文件更新

  • 成本差異疑難排解指南 - PR #25622
  • 第 2 週上手檢查清單 - PR #25452
  • 在文件網站新增「將頁面複製為 Markdown」+ llms.txt - PR #25975
  • Trivy 事件修復的文件公告列 - PR #25870
  • 將 docs.litellm.ai/blog 重新設計為工程部落格風格 - PR #25580
  • Ramp 風格工程部落格重新設計 + Redis circuit breaker 文章 - PR #25583
  • 為部落格文章頁面新增返回箭頭 - PR #25587
  • 備援圖片 - PR #25731
  • 一般文件更新 - PR #25736
  • 補上 v1.83.3-stable 與 v1.83.7.rc.1 的版本更新說明 - PR #25723, PR #25726
  • 修正文件中顯示的版本 - PR #25875

新貢獻者

完整更新記錄https://github.com/BerriAI/litellm/compare/v1.83.7-stable...v1.83.10-stable


04/27/2026

  • 新模型 / 更新模型:23
  • LLM API 端點:18
  • 管理端點 / UI:22
  • AI 整合(記錄 / 防護欄 / 快取 / 提示詞):16
  • 支出追蹤、預算與速率限制:13
  • MCP 閘道:6
  • 效能 / 負載平衡 / 可靠性改善:17
  • 文件更新:11