跳至主要內容

v1.76.3-stable - 效能、影片生成與 CloudZero 整合

注意

此版本有一個已知問題:在 Kubernetes 上部署時,啟動會導致記憶體不足錯誤。我們建議在升級到此版本之前先暫緩。

部署此版本

docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.76.3

重點亮點

  • 主要效能改善:在使用正確的 workers 數量 + CPU 核心組合時,提升 +400 RPS
  • 影片生成支援:透過 LiteLLM Pass through routes 新增 Google AI Studio 和 Vertex AI Veo 影片生成
  • CloudZero 整合:新的成本追蹤整合,可將 LiteLLM 用量與支出資料匯出到 CloudZero。

主要變更

  • 效能最佳化:LiteLLM Proxy 在使用正確數量的 CPU 核心時,現在可達到 +400 RPS - PR #14153, PR #14242

    預設情況下,LiteLLM 現在會使用 num_workers = os.cpu_count() 以達到最佳效能。

    覆寫選項:

    設定環境變數:

    DEFAULT_NUM_WORKERS_LITELLM_PROXY=1

    或以以下方式啟動 LiteLLM Proxy:

    litellm --num_workers 1
  • 安全性修正:修正 memory_usage_in_mem_cache cache endpoint 漏洞 - PR #14229


效能改善

此版本包含重大的效能最佳化。在我們的內部基準測試中,使用正確的 workers 數量 + CPU 核心組合時,1 個 instance 可達到 +400 RPS。

  • +400 RPS 效能提升 - LiteLLM Proxy 現在會使用正確數量的 CPU 核心以達到最佳效能 - PR #14153
  • 預設 CPU Workers - 將 DEFAULT_NUM_WORKERS_LITELLM_PROXY 的預設值改為 CPU 數量 - PR #14242

新模型 / 已更新模型

新模型支援

提供者模型上下文視窗輸入 ($/100萬 tokens)輸出 ($/100萬 tokens)功能
OpenRouteropenrouter/openai/gpt-4.11M$2.00$8.00含 vision 的 chat completions
OpenRouteropenrouter/openai/gpt-4.1-mini1M$0.40$1.60高效率 chat completions
OpenRouteropenrouter/openai/gpt-4.1-nano1M$0.10$0.40超高效率 chat
Vertex AIvertex_ai/openai/gpt-oss-20b-maas131K$0.075$0.30推理支援
Vertex AIvertex_ai/openai/gpt-oss-120b-maas131K$0.15$0.60進階推理
Geminigemini/veo-3.0-generate-preview1K-$0.75/秒影片生成
Geminigemini/veo-3.0-fast-generate-preview1K-$0.40/秒快速影片生成
Geminigemini/veo-2.0-generate-0011K-$0.35/秒影片生成
Volcenginedoubao-embedding-large4K免費免費2048 維 embeddings
Together AItogether_ai/deepseek-ai/DeepSeek-V3.1128K$0.60$1.70推理支援

功能

錯誤修正

新提供者支援


LLM API 端點

功能

  • Images API
    • 新增 OpenAI 上的 pass through image generation 與 image editing - PR #14292
    • 支援 image generation 的 extra_body 參數 - PR #14211
  • Responses API
    • 修正 litellm proxy 的 response API,處理輸入中的 reasoning item - PR #14200
    • 為 SDK 新增結構化輸出 - PR #14206
  • Bedrock 傳遞
    • 在 bedrock passthrough 上支援 AWS_BEDROCK_RUNTIME_ENDPOINT - PR #14156
  • Google AI Studio 傳遞
    • 允許透過 LiteLLM Pass through routes 使用 Veo 影片生成 - PR #14228
  • 一般
    • 新增 chat.completions.create 的 safety_identifier 參數支援 - PR #14174
    • 修正 /chat/completions 請求中無效 image_url 的 500 錯誤誤判 - PR #14149
    • 修正 Gemini CLI 的 token 計數錯誤 - PR #14133

錯誤

  • 一般
    • 當 model name 作為 h11 header name 使用時,移除其中的 "/" 或 ":" - PR #14191
    • openai.gpt-oss 在使用 reasoning_effort 參數時的錯誤修正 - PR #14300

支出追蹤、預算與速率限制

功能

  • 新增 spend_logs_metadata 的 header 支援 - PR #14186
  • 用於 chat completion 的 Litellm passthrough 成本追蹤 - PR #14256

錯誤修正

  • 修正 TPM Rate Limit Bug - PR #14237
  • 修正 Key Budget 未在預期時間重置 - PR #14241

管理端點 / UI

功能

  • UI 改進
    • 已修正 Logs 頁面螢幕大小 - PR #14135
    • 成功時新增建立組織工具提示 - PR #14132
    • Back to Keys 應顯示為 Back to Logs - PR #14134
    • 在 All Models 表格新增用戶端分頁 - PR #14136
    • Model Filters UI 改進 - PR #14131
    • 移除 user info 頁面的表格篩選器 - PR #14169
    • 在 User Details 新增團隊名稱徽章 - PR #14003
    • 修正:Logs 頁面參數傳遞錯誤 - PR #14193
  • 驗證與授權
    • 支援 ES256/ES384/ES512 和 EdDSA JWT 驗證 - PR #14118
    • 確保 team_id 是產生服務帳戶金鑰的必要欄位 - PR #14270

錯誤

  • 一般
    • 驗證 db 設定中的 store model - PR #14269

記錄 / 防護欄整合

功能

防護欄

  • 在 Anthropic API 端點新增防護欄 - PR #14107

新整合


效能 / 負載平衡 / 可靠性改進

功能

  • 效能
    • LiteLLM Proxy:使用正確數量的 CPU 核心時 +400 RPS - PR #14153
    • 允許在請求中使用 x-litellm-stream-timeout 標頭設定串流逾時 - PR #14147
    • 將 DEFAULT_NUM_WORKERS_LITELLM_PROXY 預設值改為 CPU 數量 - PR #14242
  • 監控
    • 新增缺少的 Prometheus 指標 - PR #14139
  • 逾時
    • 串流逾時控制 - 允許在請求中使用 x-litellm-stream-timeout 標頭設定串流逾時 - PR #14147
  • 路由
    • 已修正 x-litellm-tags 在使用 Responses API 時無法路由 - PR #14289

錯誤

  • 安全性
    • 已修正 memory_usage_in_mem_cache 快取端點漏洞 - PR #14229

一般 Proxy 改進

功能

  • SCIM 支援
    • 新增更好的 SCIM 除錯 - PR #14221
    • 處理 SCIM 群組成員資格的錯誤修正 - PR #14226
  • Kubernetes
    • 為 litellm proxy 新增可選的 PodDisruptionBudget - PR #14093
  • 錯誤處理
    • 在 azure 錯誤訊息中加入 model - PR #14294

新貢獻者

  • @iabhi4 在 PR #14093 完成了首次貢獻
  • @zainhas 在 PR #14087 完成了首次貢獻
  • @LifeDJIK 在 PR #14146 完成了首次貢獻
  • @retanoj 在 PR #14133 完成了首次貢獻
  • @zhxlp 在 PR #14193 完成了首次貢獻
  • @kayoch1n 在 PR #14191 完成了首次貢獻
  • @kutsushitaneko 在 PR #14171 完成了首次貢獻
  • @mjmendo 在 PR #14176 完成了首次貢獻
  • @HarshavardhanK 在 PR #14213 完成了首次貢獻
  • @eycjur 在 PR #14207 完成了首次貢獻
  • @22mSqRi 在 PR #14241 完成了首次貢獻
  • @onlylhf 在 PR #14028 完成了首次貢獻
  • @btpemercier 在 PR #11319 完成了首次貢獻
  • @tremlin 在 PR #14287 完成了首次貢獻
  • @TobiMayr 在 PR #14262 完成了首次貢獻
  • @Eitan1112 在 PR #14252 完成了首次貢獻

完整變更紀錄