v1.83.10 - Claude Opus 4.7、Prompt Compression 與 Multi-Window Budgets
部署此版本
- Docker
- Pip
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:main-v1.83.10-stable
pip install litellm==1.83.10
主要亮點
- Claude Opus 4.7 首日支援 — Opus 4.7 於 Anthropic、Bedrock、Vertex AI、Azure AI 與 Perplexity 均可使用,並支援 reasoning、vision、prompt caching、computer use 與 1M token context。
litellm.compress()— 基於 BM25 且搭配檢索工具的 prompt 壓縮,可在長 context 進入模型前將其裁切。- 多閾值預算警示 — 虛擬 key 可在多個可設定的支出閾值觸發警示(例如 50% / 80% / 95%),而不是只有單一 soft-budget 層級。
- 並行預算視窗 — key 與 team 可同時執行多個預算期間(每日 + 每月),每個期間都有自己的重設節奏。
- 每個 Team 的 Guardrail 退出選項 — team 可在 team 設定中選擇退出特定全域 guardrail,無須變更設定檔。
- PromptGuard Guardrail 整合 — 用於 prompt-injection 偵測的一等級 pre/post-call guardrail。
- uv 套件封裝遷移 — 以 uv 取代 Poetry,涵蓋套件封裝、CI 與 Docker,以加快且可重現的建置。
破壞性變更
除非 key/team 選擇加入,否則呼叫端提供的 tags 會被移除
-
變更內容: 由呼叫端提供的標籤 —
metadata.tags、litellm_metadata.tags、根層級tags,以及x-litellm-tagsheader — 會在 基於標籤的路由 與 基於標籤的支出歸屬 執行前,從請求中移除,除非呼叫用 key 或其父層 team 帶有metadata.allow_client_tags: true。在模型部署、key 中繼資料或 team 中繼資料上設定的標籤不受影響。每次移除時,proxy 都會記錄一行WARNING:Stripped caller-supplied tags from metadata, tags (root): this key/team does not have `allow_client_tags: true` in its metadata. Set it to opt into client-supplied routing/budget tags. -
受影響對象: 任何仰賴用戶端在請求本文或
x-litellm-tagsheader 中傳入tags,以進行基於標籤的成本追蹤、標籤預算或基於標籤路由的部署。升級後,這些標籤將靜默落入預設 bucket / 預設部署,而依標籤的支出報告將顯示為空白。 -
恢復先前行為: 在受影響 key(或其所屬 team)的中繼資料中設定
allow_client_tags: true。任一旗標即可生效——只要該 key 或其父層 team 帶有此旗標,呼叫端提供的標籤就會通過。# Per key
curl -L -X POST 'http://0.0.0.0:4000/key/generate' \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"metadata": {"allow_client_tags": true}}'
# Per team
curl -L -X POST 'http://0.0.0.0:4000/team/new' \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"metadata": {"allow_client_tags": true}}'既有的 key/team 可透過
/key/update或/team/update進行修補,並帶入相同的metadatapayload。
UI 或 API 中的 os.environ/… 值
-
變更內容: 像
os.environ/OPENAI_API_KEY(以及其他os.environ/…模式)這類值,當它們來自請求提供的欄位時,不再展開——包含 Admin UI 以及 UI 所呼叫的相同 proxy APIs。— PR #25592 -
受影響對象: 任何在 UI 或 API 中輸入字面上的
os.environ/SECRET_NAME字串,並預期 proxy 在執行時以主機環境變數代入的人。 -
替代做法: 提供者 API 金鑰與類似機密應使用 Reusable Credentials 儲存,並附加至模型(例如透過
litellm_credential_name)。對於可觀測性回呼(Langfuse、LangSmith 等),請將 key 與 endpoint 設定在 proxyconfig.yaml中,或設定在程序在啟動時讀取的環境變數中——不要作為每個請求中中繼資料內的os.environ/…字串。
新模型 / 更新模型
新模型支援(10 個新模型)
| 提供者 | 模型 | 上下文視窗 | 輸入($/百萬 tokens) | 輸出($/百萬 tokens) | 功能 |
|---|---|---|---|---|---|
| Anthropic | claude-opus-4-7, claude-opus-4-7-20260416 | 1M | $5.00 | $25.00 | Chat、reasoning、vision、computer use、prompt caching、PDF input、xhigh reasoning effort |
| AWS Bedrock | anthropic.claude-opus-4-7, us.anthropic.claude-opus-4-7, eu.anthropic.claude-opus-4-7, au.anthropic.claude-opus-4-7, global.anthropic.claude-opus-4-7 | 1M | $5.50 | $27.50 | Chat、reasoning、vision、computer use、prompt caching、PDF input、native structured output |
| Vertex AI | vertex_ai/claude-opus-4-7, vertex_ai/claude-opus-4-7@default | 1M | $5.00 | $25.00 | Chat、reasoning、vision、computer use、prompt caching、PDF input |
| Azure AI | azure_ai/claude-opus-4-7 | 200K | $5.00 | $25.00 | Chat、reasoning、vision、computer use、prompt caching、PDF input |
| Perplexity | perplexity/anthropic/claude-opus-4-7 | - | - | - | Web search、function calling(Responses mode) |
| Google Gemini | gemini/veo-3.1-lite-generate-preview | 1024 | - | $0.05 / sec | 影片生成預覽 |
| OpenRouter | openrouter/google/gemini-3.1-flash-lite-preview | 1.05M | $0.25 | $1.50 | Chat、code execution、file search、function calling、prompt caching、reasoning、web search、vision、video/audio/PDF input |
| xAI | xai/grok-4.20-0309-reasoning | 2M | $2.00 | $6.00 | Function calling、reasoning、tool choice、vision、web search |
| W&B Inference | wandb/MiniMaxAI/MiniMax-M2.5 | 197K | $0.30 | $1.20 | Function calling、reasoning、response schema |
| W&B Inference | wandb/moonshotai/Kimi-K2.5 | 262K | $0.60 | $3.00 | Function calling、reasoning、response schema、vision |
功能
-
- 標準化 Invoke 與 Converse APIs 的自訂工具 JSON schema - PR #25396
- Bedrock API 回應 null 型別處理 - PR #25810、PR #24147
- 防止僅起始快取使用產生負的串流成本 - PR #25846
- 在 UI 與 SpendLogs 中準確顯示快取 token 成本拆分 - PR #25735
- 移除 Bedrock 測試檔案中未解決的合併衝突標記 - PR #25995
- 以請求本文 mock 取代不穩定的 Bedrock gpt-oss tool-call live test - PR #25739
- Mock Bedrock Moonshot tests + 修正
TogetherAIConfig遞迴 - PR #25920 - 移除已無作用的 Bedrock
clear_thinkinginterleaved-thinking-beta 斷言 - PR #25913
-
- Veo 3.1 Lite 的定價、影片解析度用量,以及分級成本追蹤 - PR #25348
-
- 新增
azure_ai/claude-opus-4-7成本對應條目 - 成本對應 - 透過 logging hook 為 Azure passthrough 填入
standard_logging_object- PR #25679
- 新增
-
- 新增
xai/grok-4.20-0309-reasoning成本對應條目 - PR #25930
- 新增
-
- 為明確的 prompt caching 保留
cache_control- PR #25331
- 為明確的 prompt caching 保留
-
- 允許覆寫預設的 GitHub Copilot 驗證端點 - PR #25915
-
- 新增 Kimi-K2.5 和 MiniMax-M2.5 成本對應條目 - PR #25409
Bug 修正
-
- 回傳來自
/v1/messages/count_tokens的實際上游狀態碼,而非一律 200 - PR #21352
- 回傳來自
-
- Gemini
finish_reasonenum 正規化(請見上方 Features)- PR #25337
- Gemini
-
- 在下游回歸之後,回復對空值
encoding_format的省略 - PR #25698
- 在下游回歸之後,回復對空值
-
一般
- 修正文件橫幅中顯示的
version- PR #25875
- 修正文件橫幅中顯示的
LLM API 端點
功能
-
- 將 Responses API 參數新增至 cache key allow-list - PR #25673
-
- Veo 3.1 Lite 感知解析度的分級成本追蹤 - PR #25348
-
一般 —
litellm.compress()- 新的基於 BM25 的 prompt 壓縮 API 搭配 retrieval 工具,透過
litellm.compress()公開,用於在模型呼叫前截短長 prompt - PR #25637
- 新的基於 BM25 的 prompt 壓縮 API 搭配 retrieval 工具,透過
錯誤
- 一般
- 在憑證驗證中收緊
api_key值檢查 - PR #25917 - 收緊請求參數中的環境參照處理 - PR #25592
- 強化請求參數處理 - PR #25827
- 新增共用路徑工具並防止目錄遍歷 - PR #25834
- 為使用者提供的 URL 新增 URL 驗證 - PR #25906
- 從管理中繼資料讀取 guardrail 設定;修正標籤路由一致性 - PR #25905
- 在管理操作中強制執行組織邊界 - PR #25904
- 解決
prometheus_helpers檔案/套件遮蔽,避免破壞/global/spend/logs- PR #26026 - 強化 CORS 憑證、
create_views例外處理,以及 spend-log 清理迴圈 - PR #25559 - 防止 API 金鑰外洩於錯誤追蹤回溯、記錄與警示中 - PR #25117
- 移除 license
public_key.pem前導空白 - PR #25339 - 快取失效:停止在大量更新與金鑰輪替中對 token 進行雙重雜湊 - PR #25552
model_max_budget對已路由模型靜默失效 - PR #25549- 升級 25 個由 dependabot 回報的脆弱相依套件中的 22 個 - PR #25442
- 修正
multiple values在TypeError中的get_cache_key- PR #20261 - S3v2:對 SigV4 簽署的 S3 請求使用已準備好的 URL - PR #25074
- 健康檢查 reasoning-token 與 max-token 的優先順序 - PR #25936
BACKGROUND_HEALTH_CHECK_MAX_TOKENS環境變數 - PR #25344- 批次限制過時的受管理物件清理,以避免 30 萬列 UPDATE - PR #25227
- 保留
StandardLoggingPayload中的提供者回應標頭 - PR #25807 - 最佳化 DB 查詢,以防健康檢查期間發生 OOM - PR #25732
PodLockManager.release_lock原子式 compare-and-delete(重新納入 #21226)- PR #24466routing_strategy_args在策略不是基於延遲時回傳None- PR #25882is_tool_name_prefixed針對已知 MCP 伺服器前綴進行驗證 - PR #25085- 在重新啟動之間保留預設 router 終止預算 - PR #25991
- 在 team 範圍的金鑰管理檢查中強制執行團隊成員資格 - PR #25686
- 代理程式端點與路由權限檢查 - PR #25922
- Prometheus metrics 的 JWT 驗證
key_alias=user_id— 初始修正與回復 - PR #25340, PR #25438 - 將 post-custom-auth DB 查詢設為需 opt-in 的旗標後才執行 - PR #25634
- 對齊使用者與金鑰更新端點中的欄位層級檢查 - PR #25541
- 與使用者範圍一致的
/spend/logs篩選處理 - PR #25594 - 以 RestrictedPython 取代
custom_codeguardrail 沙箱 - PR #25818 - Presidio:在
anonymize_text中使用正確的文字位置 - PR #24998
- 在憑證驗證中收緊
管理端點 / UI
功能
-
虛擬金鑰
-
團隊
-
模型 + 端點
- UI 設定中支援 Claude Code BYOK - PR #25998
- Add Model 流程的 E2E 測試 - PR #25590
- 為布林值防護欄提供者欄位預先選取後端預設值 - PR #25700
- 在
Select中呈現防護欄optional_params布林預設值 - PR #25806 - MCP
ToolTestPanel布林輸入改用 AntDSelect- PR #25809 - 在 MCP 伺服器編輯時保留
extra_headers- PR #26003 - 將 Guardrail Test Playground 從
@tremor/react移轉到 AntD - PR #25749 - 將 router_settings 頁面從 Tremor 移轉到 AntD - PR #25879
- 減少 Guardrails Monitor 版面配置中的 Tremor 使用量 - PR #25803
- 從 Swagger 文件訊息中移除 Chat UI 連結 - PR #25727
- 透過受控對話框刪除 policy 附件 - PR #25324
-
驗證 / SSO
-
記錄 / 活動
-
Helm
- 將
tpl支援加入extraContainers與extraInitContainers- PR #25494
- 將
錯誤
- 從金鑰更新負載中移除空的 premium 欄位 - PR #26023
- 收緊憑證驗證中的
api_key值檢查 - PR #25917 extra_headers未在 MCP 伺服器編輯時持久化 - PR #26003- logs 團隊篩選下拉選單外洩 - PR #25716
- 在
user_dashboard測試中的cookieUtils模擬物件加入getCookie- PR #25719 - 移除已棄用的
tests/ui_e2e_tests/測試套件 - PR #25657 - 限制
x-pass-標頭轉送 - PR #25916 - Blog 深色模式文字在深色背景上無法顯示 - PR #25620
- 預設邀請使用者角色為最小權限 - PR #25721
AI 整合
記錄
-
- 透過 logging hook 填入
standard_logging_object- PR #25679
- 透過 logging hook 填入
-
一般
- 在
StandardLoggingPayload中保留提供者回應標頭 - PR #25807
- 在
防護欄
-
- 用於提示注入偵測的新 PromptGuard 防護欄整合 - PR #24268
-
- 將
custom_codesandbox 取代為 RestrictedPython - PR #25818
- 將
-
- 在
anonymize_text中使用正確的文字位置 - PR #24998
- 在
-
一般
快取
- 將 Responses API 參數加入快取金鑰允許清單 - PR #25673
- 防止
multiple valuesTypeError於get_cache_key中發生 - PR #20261 - S3v2:對 SigV4 簽章的 S3 請求使用已準備的 URL - PR #25074
提示管理 / 壓縮
- 以檢索工具推出新的
litellm.compress()、基於 BM25 的 prompt compression API - PR #25637
密鑰管理器
- 此版本沒有新增密鑰管理器提供者。
支出追蹤、預算與速率限制
- 虛擬金鑰可設定多門檻預算警示(例如 50% / 80% / 95%) - PR #25989
- API 金鑰與團隊的多個並行預算視窗(
#24883) - PR #25109 - Bedrock/Anthropic 在 UI 與 SpendLogs 中的快取 token 成本明細更精確 - PR #25735
- Bedrock:防止僅起始快取用量產生負值串流成本 - PR #25846
- 修正虛擬金鑰預估支出軟性預算警示 - PR #25838
- 在並行請求限制器中強制執行專案層級、模型特定的速率限制 - PR #25994
- 重新啟動後保留預設路由器 end-budget - PR #25991
- 將舊版實體(Team Members、End Users)的重設時間與標準化行事曆對齊 - PR #25440
- 批次限制過期 managed-object 清理,以避免 30 萬列 UPDATE - PR #25227
- 快取失效:停止在批次更新與金鑰輪替中對 token 進行雙重雜湊 - PR #25552
model_max_budget對已路由模型悄然失效 - PR #25549- 在
get_model_info中公開 reasoning-effort 欄位(並將together_ai/gpt-oss-120b加入成本對照表) - PR #25263 - Veo 3.1 Lite 具解析度感知的分級成本追蹤 - PR #25348
- 為 Vertex
qwen3-235b-a22b-instruct-2507-maas成本對照表新增us-south1區域 - PR #25382
MCP 閘道
- 根據已知 MCP server 前綴集合驗證
is_tool_name_prefixed- PR #25085 - 在未儲存的每位使用者 token 不存在時,恢復觸發 PKCE 的 401 - PR #26032
- 從 MCP 閘道公開每個伺服器的
InitializeResult.instructions- PR #25694 - 將共用 PKCE 輔助函式抽出至
utils/pkce.ts- PR #25878 - UI:MCP
ToolTestPanel布林輸入改用 AntDSelect- PR #25809 - UI:在 MCP 伺服器編輯時保留
extra_headers- PR #26003
效能 / 負載平衡 / 可靠性改善
- Prometheus 匯出器效能改善 - PR #25934
- 最佳化 DB 查詢以防止健康檢查期間發生 OOM - PR #25732
PodLockManager.release_lock原子比較並刪除(#21226 的重新上線) - PR #24466- 健康檢查 reasoning-token max-token 優先順序 - PR #25936
- 新的
BACKGROUND_HEALTH_CHECK_MAX_TOKENS環境變數 - PR #25344 - 當策略不是以延遲為基礎時,回傳
None給routing_strategy_args- PR #25882 - 提升 proxy 相依性;將最低 Python 版本提高至 3.10 - PR #26022
- 升級 25 個由 dependabot 回報的脆弱相依性中的 22 個 - PR #25442
- 將 packaging、CI 與 Docker 從 Poetry 遷移至 uv - PR #25007
[Infra]將llm_translation_testing資源類別提升至xlarge,並容忍 worker 重新啟動 - PR #25887, PR #25898[Infra]擴充非mainPR 目標的 CI 分支篩選條件 - PR #25819[Infra]限制main只接受來自 staging 與 hotfix 分支的 PR - PR #25733[Infra]從 CircleCI 設定中移除未使用的publish_proxy_extras與prisma_schema_sync工作 - PR #25821fix(ci):將test-server-root-path逾時時間提高至 30m - PR #25741- 從 coverage combine 中移除不存在的
litellm_mcps_tests_coverage- PR #25737 - Helm:為
extraContainers/extraInitContainers新增tpl支援 - PR #25494 - 非 Anthropic 提供者的 Advisor 工具協調迴圈 - PR #25579
文件更新
- 成本差異疑難排解指南 - PR #25622
- 第 2 週上手檢查清單 - PR #25452
- 在文件網站新增「將頁面複製為 Markdown」+
llms.txt- PR #25975 - Trivy 事件修復的文件公告列 - PR #25870
- 將 docs.litellm.ai/blog 重新設計為工程部落格風格 - PR #25580
- Ramp 風格工程部落格重新設計 + Redis circuit breaker 文章 - PR #25583
- 為部落格文章頁面新增返回箭頭 - PR #25587
- 備援圖片 - PR #25731
- 一般文件更新 - PR #25736
- 補上 v1.83.3-stable 與 v1.83.7.rc.1 的版本更新說明 - PR #25723, PR #25726
- 修正文件中顯示的版本 - PR #25875
新貢獻者
- @hunterchris 首次貢獻於 https://github.com/BerriAI/litellm/pull/20261
- @Dmitry-Kucher 首次貢獻於 https://github.com/BerriAI/litellm/pull/24998
- @kulia26 首次貢獻於 https://github.com/BerriAI/litellm/pull/25071
- @jaxhend 首次貢獻於 https://github.com/BerriAI/litellm/pull/23532
- @abhyudayareddy 首次貢獻於 https://github.com/BerriAI/litellm/pull/25337
- @avarga1 首次貢獻於 https://github.com/BerriAI/litellm/pull/25263
- @acebot712 首次貢獻於 https://github.com/BerriAI/litellm/pull/24268
- @meutsabdahal 首次貢獻於 https://github.com/BerriAI/litellm/pull/25395
- @shreyescodes 首次貢獻於 https://github.com/BerriAI/litellm/pull/25559
- @Lucas-Song-Dev 首次貢獻於 https://github.com/BerriAI/litellm/pull/25324
- @steromano87 首次貢獻於 https://github.com/BerriAI/litellm/pull/25915
- @jlav 首次貢獻於 https://github.com/BerriAI/litellm/pull/25494
完整更新記錄:https://github.com/BerriAI/litellm/compare/v1.83.7-stable...v1.83.10-stable
04/27/2026
- 新模型 / 更新模型:23
- LLM API 端點:18
- 管理端點 / UI:22
- AI 整合(記錄 / 防護欄 / 快取 / 提示詞):16
- 支出追蹤、預算與速率限制:13
- MCP 閘道:6
- 效能 / 負載平衡 / 可靠性改善:17
- 文件更新:11