开源litellm Releases·原文 2026年9月18日

LiteLLM发布v1.103.0-dev.2,新增团队级模型预算与路由影子流量

这是一个开发预览版,主要变化包括:团队级model_max_budget、支持密钥级覆盖;路由支持影子流量流式转发和silent_model多目标分发;价格表同步 278 个模型,新增 59 个、弃用 30 个。

AI解读:LiteLLM发布v1.103.0-dev.2,这是开发预览版而不是稳定版,版本号带dev.2后缀。所有Docker镜像都用cosign签名,仓库建议用固定的commit hash 0112e53来验证签名,而不是用发布标签,因为commit hash在密码学上不可变。

对自建LLM网关的团队来说,比较实用的变化是团队级model_max_budget加上密钥级覆盖——可以给一个团队设总预算,再针对个别key单独调高或调低。另外 /key/list支持按active、expired、revoked、deleted状态过滤,虚拟密钥还能看到生命周期总花费total_spend。

路由层面这次加了影子流量流式转发,以及把silent_model扇出到多个目标;HTTP客户端可以选开启HTTP/2。成本核算继续细修:Fireworks AI的缓存写入、推理和音频token改用共享成本计算器计费,流式响应在没有usage字段时重新统计token。

价格表同步覆盖Azure、Azure AI、Gemini、OpenAI、Bedrock、Together AI、Fireworks和Vertex,共 278 个模型,其中 59 个新增、30 个弃用;Gemini单独同步了 22 个模型。这些是版本说明里列出的变更,具体行为要按对应PR确认。

需要留意的是:来源是发布说明摘要加变更列表,只覆盖到列表里写出的项目,没写的改动不代表没有;开发预览版也不适合直接上生产。

LiteLLM发布v1.103.0-dev.2。这是一个开发预览版,发布说明中列出了这一版本的变更清单,并以cosign签名的方式提供Docker镜像验证。

发布说明明确:所有LiteLLM Docker镜像都用cosign签名,每个版本都用commit 0112e53引入的同一把密钥签名。仓库推荐用固定的commit hash验证,因为commit hash在密码学上不可变;用发布标签验证更方便,但依赖标签保护规则生效。

签名验证方式

发布说明给出两条cosign verify命令,分别对应固定commit hash和发布标签两种取公钥的方式。用commit hash的方式被标为推荐;用发布标签的方式更容易读,但说明中写明它依赖仓库的标签保护规则。

说明还列出了预期输出:cosign声明通过验证,签名与指定公钥匹配。命令针对的镜像是ghcr.io/berriai/litellm:v1.103.0-dev.2。

  • 所有LiteLLM Docker镜像用cosign签名
  • 每个版本使用commit 0112e53引入的同一把密钥
  • 推荐用固定commit hash取公钥验证,标签方式依赖标签保护

预算与密钥管理

这一版新增团队级model_max_budget,并允许密钥级覆盖;团队管理员在开启相关选项后可以编辑rpm_limit和max_budget。虚拟密钥增加生命周期总花费total_spend的暴露。

密钥列表接口 /key/list支持按active、expired、revoked、deleted状态过滤,/key/info也会返回已删除的密钥信息。另有一项修复专门处理重复的用户预算钩子把零成本模型误判成 429 的问题。

  • 新增团队级model_max_budget,支持密钥级覆盖
  • 团队管理员可按开关编辑rpm_limit与max_budget
  • /key/list支持按四种状态过滤
  • 虚拟密钥暴露生命周期total_spend
  • 修复零成本模型被重复预算钩子返回 429

路由与请求处理

路由方面,这一版支持流式影子流量,并把silent_model扇出到多个目标;还新增为托管在OpenAI兼容接口上的模型自动发现token上限。fallback目标会重新检查预算,这是一个带感叹号的破坏性变更标记(fix!:)。

HTTP层新增可选的对外HTTP/2支持,用于httpx客户端。流式处理有若干修复:Anthropic流式响应在message_delta事件缺少usage时也能容忍;Responses API流式桥接会处理空choices的分片;流式响应结束但没有usage时重新统计token。内容过滤改为对每个流式分片扫描有界窗口。

  • 路由支持流式影子流量,silent_model可扇出多个目标
  • 为托管OpenAI兼容模型发现token上限
  • fallback目标重新检查预算(破坏性变更标记)
  • httpx客户端可选用HTTP/2
  • Anthropic流式容忍缺少usage的message_delta
  • 流式响应缺少usage时重新统计token

成本核算与价格同步

Fireworks AI的缓存写入、推理和音频token改为通过共享成本计算器计费;xAI Responses API保留instructions,让系统消息在网页搜索后仍然存在;DashScope会把reasoning_effort转发给提供方;Bedrock Nova的InvokeModel路由支持提示缓存。

价格同步覆盖Azure、Azure AI、Gemini、OpenAI、Bedrock、Together AI、Fireworks和Vertex:278 个模型,59 个新增,30 个弃用。Gemini单独同步 22 个模型;Together AI单独同步 6 个模型、6 个弃用,但那一批同步中Google Gemini部分标记为失败。

  • Fireworks AI缓存写入、推理和音频token走共享成本计算器
  • xAI Responses API保留instructions以保住系统消息
  • Bedrock Nova的InvokeModel路由支持提示缓存
  • 价格同步 278 个模型,59 个新增、30 个弃用
  • Gemini同步 22 个模型;Together AI 6个模型、6 个弃用
  • Together AI那一批同步中Google Gemini部分失败

其他修复与Rust重构

代理侧修复包括:/anthropic直通不再把LiteLLM虚拟密钥转发给Anthropic;管理端模型访问被拒的错误里隐藏模型白名单;AWS Secrets Manager在密钥别名变更时重命名机密;Bedrock agent-runtime直通不再转发LiteLLM凭据头。

MCP相关改动包括:JWT OAuth凭据持久化需要授权;上游凭据缺失时失败关闭;健康发现限制在虚拟密钥授权范围内;管理端静态头计为api_key凭据槽位;工具执行期间保留按请求选择的护栏。

Rust侧继续拆分:抽出auth和cache crate,新增Redis缓存crate脚手架、独立framing crate,并映射Anthropic Messages转换;同时移除了gateway、config、router、realtime以及Rust trace对齐插桩。发布说明中这条移除未展开说明原因。

  • /anthropic直通不再转发LiteLLM虚拟密钥
  • 模型访问被拒错误中隐藏模型白名单
  • AWS Secrets Manager在密钥别名变更时重命名机密
  • MCP上游凭据缺失时失败关闭,健康发现限制在虚拟密钥授权内
  • Rust拆出auth、cache crate,新增Redis缓存和framing crate
  • 移除gateway、config、router、realtime及Rust trace对齐插桩

信息来源

litellm Releases原始来源