v1.76.3-stable - 效能、影片生成與 CloudZero 整合
注意
此版本有一個已知問題:在 Kubernetes 上部署時,啟動會導致記憶體不足錯誤。我們建議在升級到此版本之前先暫緩。
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.76.3
pip install litellm
pip install litellm==1.76.3
重點亮點
- 主要效能改善:在使用正確的 workers 數量 + CPU 核心組合時,提升 +400 RPS
- 影片生成支援:透過 LiteLLM Pass through routes 新增 Google AI Studio 和 Vertex AI Veo 影片生成
- CloudZero 整合:新的成本追蹤整合,可將 LiteLLM 用量與支出資料匯出到 CloudZero。
主要變更
-
效能最佳化:LiteLLM Proxy 在使用正確數量的 CPU 核心時,現在可達到 +400 RPS - PR #14153, PR #14242
預設情況下,LiteLLM 現在會使用
num_workers = os.cpu_count()以達到最佳效能。覆寫選項:
設定環境變數:
DEFAULT_NUM_WORKERS_LITELLM_PROXY=1或以以下方式啟動 LiteLLM Proxy:
litellm --num_workers 1 -
安全性修正:修正 memory_usage_in_mem_cache cache endpoint 漏洞 - PR #14229
效能改善
此版本包含重大的效能最佳化。在我們的內部基準測試中,使用正確的 workers 數量 + CPU 核心組合時,1 個 instance 可達到 +400 RPS。
- +400 RPS 效能提升 - LiteLLM Proxy 現在會使用正確數量的 CPU 核心以達到最佳效能 - PR #14153
- 預設 CPU Workers - 將 DEFAULT_NUM_WORKERS_LITELLM_PROXY 的預設值改為 CPU 數量 - PR #14242
新模型 / 已更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | 輸入 ($/100萬 tokens) | 輸出 ($/100萬 tokens) | 功能 |
|---|---|---|---|---|---|
| OpenRouter | openrouter/openai/gpt-4.1 | 1M | $2.00 | $8.00 | 含 vision 的 chat completions |
| OpenRouter | openrouter/openai/gpt-4.1-mini | 1M | $0.40 | $1.60 | 高效率 chat completions |
| OpenRouter | openrouter/openai/gpt-4.1-nano | 1M | $0.10 | $0.40 | 超高效率 chat |
| Vertex AI | vertex_ai/openai/gpt-oss-20b-maas | 131K | $0.075 | $0.30 | 推理支援 |
| Vertex AI | vertex_ai/openai/gpt-oss-120b-maas | 131K | $0.15 | $0.60 | 進階推理 |
| Gemini | gemini/veo-3.0-generate-preview | 1K | - | $0.75/秒 | 影片生成 |
| Gemini | gemini/veo-3.0-fast-generate-preview | 1K | - | $0.40/秒 | 快速影片生成 |
| Gemini | gemini/veo-2.0-generate-001 | 1K | - | $0.35/秒 | 影片生成 |
| Volcengine | doubao-embedding-large | 4K | 免費 | 免費 | 2048 維 embeddings |
| Together AI | together_ai/deepseek-ai/DeepSeek-V3.1 | 128K | $0.60 | $1.70 | 推理支援 |
功能
- Google Gemini
- OpenRouter
- 新增 GPT-4.1 模型家族 - PR #14101
- Groq
- 新增 reasoning_effort 參數支援 - PR #14207
- X.AI
- 修正 XAI 成本計算 - PR #14127
- Vertex AI
- VLLM
- 處理輸出解析回應 API 輸出 - PR #14121
- Ollama
- 透過
reasoning_content新增統一的 'thinking' 參數支援 - PR #14121
- 透過
- Anthropic
- 為 anthropic citation 回應新增支援的 text 欄位 - PR #14126
- OCI 提供者
- 處理同時具有 content 和 tool_calls 的 assistant 訊息 - PR #14171
- Bedrock
- Databricks
- 新增 Databricks 對 anthropic citation API 的支援 - PR #14077
錯誤修正
新提供者支援
- Volcengine
- 新增 Volcengine embedding 模組,包含 handler 與轉換邏輯 - PR #14028
LLM API 端點
功能
- Images API
- Responses API
- Bedrock 傳遞
- 在 bedrock passthrough 上支援 AWS_BEDROCK_RUNTIME_ENDPOINT - PR #14156
- Google AI Studio 傳遞
- 允許透過 LiteLLM Pass through routes 使用 Veo 影片生成 - PR #14228
- 一般
錯誤
- 一般
支出追蹤、預算與速率限制
功能
- 新增 spend_logs_metadata 的 header 支援 - PR #14186
- 用於 chat completion 的 Litellm passthrough 成本追蹤 - PR #14256
錯誤修正
管理端點 / UI
功能
- UI 改進
- 驗證與授權
錯誤
- 一般
- 驗證 db 設定中的 store model - PR #14269
記錄 / 防護欄整合
功能
- Datadog
- 確保在 DD LLM 可觀測性追蹤上設定
apm_id- PR #14272
- 確保在 DD LLM 可觀測性追蹤上設定
- Braintrust
- 在啟用 OTEL 時修正記錄 - PR #14122
- OTEL
- 依循語義慣例的可選指標與記錄 - PR #14179
- Slack 警示
- 在傳送給 slack 的警示訊息中新增警示類型,以利更容易處理 - PR #14176
防護欄
- 在 Anthropic API 端點新增防護欄 - PR #14107
新整合
效能 / 負載平衡 / 可靠性改進
功能
- 效能
- 監控
- 新增缺少的 Prometheus 指標 - PR #14139
- 逾時
- 串流逾時控制 - 允許在請求中使用
x-litellm-stream-timeout標頭設定串流逾時 - PR #14147
- 串流逾時控制 - 允許在請求中使用
- 路由
- 已修正 x-litellm-tags 在使用 Responses API 時無法路由 - PR #14289
錯誤
- 安全性
- 已修正 memory_usage_in_mem_cache 快取端點漏洞 - PR #14229
一般 Proxy 改進
功能
- SCIM 支援
- Kubernetes
- 為 litellm proxy 新增可選的 PodDisruptionBudget - PR #14093
- 錯誤處理
- 在 azure 錯誤訊息中加入 model - PR #14294
新貢獻者
- @iabhi4 在 PR #14093 完成了首次貢獻
- @zainhas 在 PR #14087 完成了首次貢獻
- @LifeDJIK 在 PR #14146 完成了首次貢獻
- @retanoj 在 PR #14133 完成了首次貢獻
- @zhxlp 在 PR #14193 完成了首次貢獻
- @kayoch1n 在 PR #14191 完成了首次貢獻
- @kutsushitaneko 在 PR #14171 完成了首次貢獻
- @mjmendo 在 PR #14176 完成了首次貢獻
- @HarshavardhanK 在 PR #14213 完成了首次貢獻
- @eycjur 在 PR #14207 完成了首次貢獻
- @22mSqRi 在 PR #14241 完成了首次貢獻
- @onlylhf 在 PR #14028 完成了首次貢獻
- @btpemercier 在 PR #11319 完成了首次貢獻
- @tremlin 在 PR #14287 完成了首次貢獻
- @TobiMayr 在 PR #14262 完成了首次貢獻
- @Eitan1112 在 PR #14252 完成了首次貢獻