v1.77.2-stable - Bedrock Batches API
部署此版本
- Docker
- Pip
docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:main-v1.77.2-stable
pip install litellm
pip install litellm==1.77.2.post1
主要亮點
- Bedrock Batches API - 支援使用 LiteLLM 的統一 batch API(相容 OpenAI)在 Bedrock 上建立 Batch Inference Jobs
- Qwen API 分級定價 - 支援 Dashscope(Qwen)模型的成本追蹤,包含多個定價級距
新模型 / 更新模型
新模型支援
| 提供者 | 模型 | 上下文視窗 | Pricing ($/1M tokens) | 功能 |
|---|---|---|---|---|
| DeepInfra | deepinfra/deepseek-ai/DeepSeek-R1 | 164K | Input: $0.70 Output: $2.40 | 聊天 completions、工具呼叫 |
| Heroku | heroku/claude-4-sonnet | 8K | 請聯絡提供者以取得定價 | 函式呼叫、tool choice |
| Heroku | heroku/claude-3-7-sonnet | 8K | 請聯絡提供者以取得定價 | 函式呼叫、tool choice |
| Heroku | heroku/claude-3-5-sonnet-latest | 8K | 請聯絡提供者以取得定價 | 函式呼叫、tool choice |
| Heroku | heroku/claude-3-5-haiku | 4K | 請聯絡提供者以取得定價 | 函式呼叫、tool choice |
| Dashscope | dashscope/qwen-plus-latest | 1M | 分級定價: • 0-256K tokens: $0.40 / $1.20 • 256K-1M tokens: $1.20 / $3.60 | 函式呼叫、推理 |
| Dashscope | dashscope/qwen3-max-preview | 262K | 分級定價: • 0-32K tokens: $1.20 / $6.00 • 32K-128K tokens: $2.40 / $12.00 • 128K-252K tokens: $3.00 / $15.00 | 函式呼叫、推理 |
| Dashscope | dashscope/qwen-flash | 1M | 分級定價: • 0-256K tokens: $0.05 / $0.40 • 256K-1M tokens: $0.25 / $2.00 | 函式呼叫、推理 |
| Dashscope | dashscope/qwen3-coder-plus | 1M | 分級定價: • 0-32K tokens: $1.00 / $5.00 • 32K-128K tokens: $1.80 / $9.00 • 128K-256K tokens: $3.00 / $15.00 • 256K-1M tokens: $6.00 / $60.00 | 函式呼叫、推理、快取 |
| Dashscope | dashscope/qwen3-coder-flash | 1M | 分級定價: • 0-32K tokens: $0.30 / $1.50 • 32K-128K tokens: $0.50 / $2.50 • 128K-256K tokens: $0.80 / $4.00 • 256K-1M tokens: $1.60 / $9.60 | 函式呼叫、推理、快取 |
功能
- Bedrock
- VLLM
- 新增轉錄端點支援 - PR #14523
- Ollama
ollama_chat/- 以清單處理 images、thinking 與 content - PR #14523
- 一般
- 新增詳細請求/回應記錄的 debug 標記 PR #14482
錯誤修正
- Azure OpenAI
- 修正 extra_body 注入導致影像生成時 payload 被拒絕的問題 - PR #14475
- LM Studio
- 解決非法 Bearer 標頭值問題 - PR #14512
LLM API 端點
錯誤修正
- /messages
- 在訊息後不要傳送 content block,若有 finish reason + usage block - PR #14477
- /generateContent
支出追蹤、預算與速率限制
功能
- Qwen API 分級定價 - 新增 Dashscope/Qwen 模型完整的分級成本追蹤 - PR #14471, PR #14479
錯誤修正
- 提供者預算 - 修正提供者預算計算 - PR #14459
管理端點 / UI
功能
- 使用者標頭對應 - 新增 X-LiteLLM Users 對應功能,以加強使用者追蹤 - PR #14485
- 金鑰解鎖 - 支援
/key/unblock端點中的雜湊 token - PR #14477 - 模型群組標頭轉送 - 以文件加強萬用字元模型支援 - PR #14528
錯誤修正
記錄 / 防護欄整合
功能
- Noma 整合 - 新增非阻塞監控模式,支援匿名化輸入 - PR #14401
效能 / 負載平衡 / 可靠性改進
效能
- 移除靜態值的動態建立 - PR #14538
- 預設使用
_PROXY_MaxParallelRequestsHandler_v3以達到最佳吞吐量 - PR #14450 - 改善執行內容傳遞至記錄工作 - PR #14455
新貢獻者
- @Sameerlite 首次貢獻於 PR #14460
- @holzman 首次貢獻於 PR #14459
- @sashank5644 首次貢獻於 PR #14469
- @TomAlon 首次貢獻於 PR #14401
- @AlexsanderHamir 首次貢獻於 PR #14538