跳至主要內容

v1.73.6-stable

部署此版本

docker run litellm
docker run \
-e STORE_MODEL_IN_DB=True \
-p 4000:4000 \
docker.litellm.ai/berriai/litellm:v1.73.6-stable.patch.1

主要重點

gemini-cli 上的 Claude


此版本帶來了在 LiteLLM 中使用 gemini-cli 的支援。

您可以在 gemini-cli 上使用 claude-sonnet-4、gemini-2.5-flash(Vertex AI 與 Google AI Studio)、gpt-4.1,以及任何 LiteLLM 支援的模型。

當您在 LiteLLM 中使用 gemini-cli 時,您會獲得以下優點:

開發者優點:

  • 通用模型存取:透過 gemini-cli 介面使用任何 LiteLLM 支援的模型(Anthropic、OpenAI、Vertex AI、Bedrock 等)。
  • 更高的速率限制與可靠性:跨多個模型與提供者進行負載平衡,以避免碰到單一提供者的限制,並以備援機制確保即使某個提供者失敗,您仍可取得回應。

Proxy 管理員優點:

  • 集中管理:透過單一 LiteLLM proxy 執行個體控制所有模型的存取,而無需將每個提供者的 API 金鑰交給您的開發人員。
  • 預算控制:設定支出上限,並追蹤所有 gemini-cli 使用情況的成本。

開始使用


Batch API 成本追蹤


v1.73.6 為 LiteLLM Managed Batch API 請求帶來成本追蹤。先前,對於使用 LiteLLM Managed Files 的 Batch API 請求並未進行此項處理。現在,LiteLLM 會將每個 batch 請求的狀態儲存在資料庫中,並在背景輪詢未完成的 batch 作業,在 batch 完成後發出支出記錄以供成本追蹤。

您端不需要任何新的旗標/變更。未來幾週內,我們希望將此擴展至涵蓋 Anthropic passthrough 的 batch 成本追蹤。

開始使用


新模型/更新模型

定價/上下文視窗更新

提供者模型上下文視窗輸入($/100萬 token)輸出($/100萬 token)類型
Azure OpenAIazure/o3-pro200k$20.00$80.00新增
OpenRouteropenrouter/mistralai/mistral-small-3.2-24b-instruct32k$0.1$0.3新增
OpenAIo3-deep-research200k$10.00$40.00新增
OpenAIo3-deep-research-2025-06-26200k$10.00$40.00新增
OpenAIo4-mini-deep-research200k$2.00$8.00新增
OpenAIo4-mini-deep-research-2025-06-26200k$2.00$8.00新增
Deepseekdeepseek-r165k$0.55$2.19新增
Deepseekdeepseek-v365k$0.27$0.07新增

更新模型

錯誤

  • Sambanova
  • Azure
    • 在 Responses API 上支援 Azure Authentication 方法(azure ad token、api keys) - PR s/o @hsuyuming
    • 將 ‘image_url’ 字串對應為巢狀字典 - PR s/o @davis-featherstone
  • Watsonx
    • 當模型是自訂部署的一部分時,將 ‘model’ 欄位設為 None——修正在這些情況下 WatsonX 拋出的錯誤 - PR s/o @cbjuan
  • Perplexity
    • 支援 web_search_options - PR
    • 支援 citation token 與搜尋查詢成本計算 - PR
  • Anthropic
    • 處理 usage 區塊中的 null 值 - PR
  • Gemini (Google AI Studio + VertexAI)
    • 只使用可接受的格式值(enum 與 datetime)——否則 gemini 會拋出錯誤 - PR
    • 若工具與快取內容一併傳入,則快取工具(否則 gemini 會拋出錯誤) - PR
    • Json schema 轉換改進:修正 unpack_def 在 anyof 項目內處理巢狀 $ref 的方式 - PR
  • Mistral
    • 修正 thinking 提示詞以符合 hugging face 建議 - PR
    • 為除 codestral-mamba 之外的所有 mistral 模型新增 supports_response_schema: true - PR
  • Ollama
    • 修正 embedding 請求上不必要的 await - PR

功能

  • Azure OpenAI
    • 檢查 o-series 模型是否支援 reasoning effort(讓 drop_params 可用於 o1 模型)
    • Assistant + tool 使用成本追蹤 - PR
  • Nvidia Nim
    • 新增 ‘response_format’ 參數支援 - PR @shagunb-acn 
  • ElevenLabs
    • 新的 STT 提供者 - PR

LLM API 端點

功能

  • /mcp
    • 將適當的 auth 字串值傳送至 /tool/call 端點,並帶上 x-mcp-auth - PR s/o @wagnerjt
  • /v1/messages
  • /chat/completions
    • 透過 chat completion 支援 Azure Responses API - PR
  • /responses
    • 為非 openai 提供者新增 reasoning 內容支援 - PR
  • [新增] /generateContent
    • 為 gemini cli 支援新增端點 - PR
    • 支援以其原生格式呼叫 Google AI Studio / VertexAI Gemini 模型 - PR
    • 為串流與非串流 vertex/google ai studio 路由新增記錄 + 成本追蹤 - PR
    • 新增從 generateContent 到 /chat/completions 的橋接 - PR
  • /batches
    • 篩選部署,只保留已寫入 Managed File 的部署 - PR
    • 將所有 model / file id 對應儲存在 db 中(先前只有第一個)——啟用「真正的」負載平衡 - PR
    • 支援指定目標模型名稱的 List Batches - PR

支出追蹤/預算改進

功能

  • 直通
    • Bedrock - 串流與非串流皆支援成本追蹤(/invoke + /converse 路由) - PR
    • VertexAI - 支援 anthropic 成本計算 - PR
  • Batches
    • 用於追蹤 LiteLLM Managed batches 成本的背景作業 - PR

管理端點/UI

錯誤

  • 一般 UI
    • 修正儀表板元件中的 today 選擇器日期變更 - PR
  • 用量
    • 彙總分頁端點所有頁面的用量資料 - PR
  • 團隊
    • 在團隊設定下拉選單中去除重複的模型 - PR
  • 模型
    • 在使用 azure model 選取「test connect」時保留公開模型名稱(先前會重設) - PR
  • 邀請連結
    • 確保使用 tf provider 時,Invite links email 內含正確的 invite id - PR

功能

  • 模型
    • 在健康檢查表格中新增「最後成功」欄位 - PR
  • MCP
    • 新的 UI 元件,支援 auth 類型:api key、bearer token、basic auth - PR s/o @wagnerjt
    • 確保內部使用者可以存取 /mcp 和 /mcp/ 路由 - PR
  • SCIM
    • 確保新使用者會套用 default_internal_user_params - PR
  • 團隊
    • 支援團隊成員金鑰的預設到期時間 - PR
    • 擴充團隊成員新增檢查以涵蓋使用者電子郵件 - PR
  • UI
    • 依 SSO 群組限制 UI 存取 - PR
  • 金鑰
    • 新增 new_key 參數以重新產生金鑰 - PR
  • 測試金鑰
    • 新的「get code」按鈕,可根據 UI 設定取得可執行的 python 程式碼片段 - PR

Logging / 防護欄 整合

錯誤

  • Braintrust
    • 將模型加入中繼資料,以啟用 braintrust 成本估算 - PR

功能

  • 回呼
    • (企業版)- 停用請求標頭中的記錄回呼 - PR
    • 新增 List Callbacks API Endpoint - PR
  • Bedrock 防護欄
    • 在 intervene 動作時不要引發例外 - PR
    • 使用 post call 時,確保 PII Masking 套用於回應串流或非串流內容 - PR
  • [NEW] Palo Alto Networks Prisma AIRS 防護欄
  • ElasticSearch
    • 新的 Elasticsearch Logging 教學 - PR
  • 訊息去識別化
    • 保留 Embedding 去識別化的用量 / 模型資訊 - PR

效能 / 負載平衡 / 可靠性改善

錯誤

  • 僅限團隊模型
    • 在非團隊請求的路由邏輯中過濾僅限團隊模型
  • 超出 Context Window 的錯誤
    • 捕捉 anthropic 例外 - PR

功能

  • 路由器
    • 允許為特定部署使用動態冷卻時間 - PR
    • 處理部署的 cooldown_time = 0 - PR
  • Redis
    • 新增更好的偵錯資訊,以查看設定了哪些變數 - PR

一般 Proxy 改善

錯誤

  • aiohttp
    • 在網路請求中檢查 HTTP_PROXY 變數
    • 允許在 trust_env 中使用 HTTP_ Proxy 設定

功能

  • 文件
    • 新增建議規格 - PR
  • Swagger
    • 引入新的環境變數 NO_REDOC 以選擇不使用 Redoc - PR

新貢獻者

Git Diff