LiteLLM发布v1.103.0-dev.2,新增团队级模型预算与路由影子流量
这是一个开发预览版,主要变化包括:团队级model_max_budget、支持密钥级覆盖;路由支持影子流量流式转发和silent_model多目标分发;价格表同步 278 个模型,新增 59 个、弃用 30 个。
AI解读:LiteLLM发布v1.103.0-dev.2,这是开发预览版而不是稳定版,版本号带dev.2后缀。所有Docker镜像都用cosign签名,仓库建议用固定的commit hash 0112e53来验证签名,而不是用发布标签,因为commit hash在密码学上不可变。
对自建LLM网关的团队来说,比较实用的变化是团队级model_max_budget加上密钥级覆盖——可以给一个团队设总预算,再针对个别key单独调高或调低。另外 /key/list支持按active、expired、revoked、deleted状态过滤,虚拟密钥还能看到生命周期总花费total_spend。
路由层面这次加了影子流量流式转发,以及把silent_model扇出到多个目标;HTTP客户端可以选开启HTTP/2。成本核算继续细修:Fireworks AI的缓存写入、推理和音频token改用共享成本计算器计费,流式响应在没有usage字段时重新统计token。
价格表同步覆盖Azure、Azure AI、Gemini、OpenAI、Bedrock、Together AI、Fireworks和Vertex,共 278 个模型,其中 59 个新增、30 个弃用;Gemini单独同步了 22 个模型。这些是版本说明里列出的变更,具体行为要按对应PR确认。
需要留意的是:来源是发布说明摘要加变更列表,只覆盖到列表里写出的项目,没写的改动不代表没有;开发预览版也不适合直接上生产。
LiteLLM发布v1.103.0-dev.2。这是一个开发预览版,发布说明中列出了这一版本的变更清单,并以cosign签名的方式提供Docker镜像验证。
发布说明明确:所有LiteLLM Docker镜像都用cosign签名,每个版本都用commit 0112e53引入的同一把密钥签名。仓库推荐用固定的commit hash验证,因为commit hash在密码学上不可变;用发布标签验证更方便,但依赖标签保护规则生效。
签名验证方式
发布说明给出两条cosign verify命令,分别对应固定commit hash和发布标签两种取公钥的方式。用commit hash的方式被标为推荐;用发布标签的方式更容易读,但说明中写明它依赖仓库的标签保护规则。
说明还列出了预期输出:cosign声明通过验证,签名与指定公钥匹配。命令针对的镜像是ghcr.io/berriai/litellm:v1.103.0-dev.2。
- 所有LiteLLM Docker镜像用cosign签名
- 每个版本使用commit 0112e53引入的同一把密钥
- 推荐用固定commit hash取公钥验证,标签方式依赖标签保护
预算与密钥管理
这一版新增团队级model_max_budget,并允许密钥级覆盖;团队管理员在开启相关选项后可以编辑rpm_limit和max_budget。虚拟密钥增加生命周期总花费total_spend的暴露。
密钥列表接口 /key/list支持按active、expired、revoked、deleted状态过滤,/key/info也会返回已删除的密钥信息。另有一项修复专门处理重复的用户预算钩子把零成本模型误判成 429 的问题。
- 新增团队级model_max_budget,支持密钥级覆盖
- 团队管理员可按开关编辑rpm_limit与max_budget
- /key/list支持按四种状态过滤
- 虚拟密钥暴露生命周期total_spend
- 修复零成本模型被重复预算钩子返回 429
路由与请求处理
路由方面,这一版支持流式影子流量,并把silent_model扇出到多个目标;还新增为托管在OpenAI兼容接口上的模型自动发现token上限。fallback目标会重新检查预算,这是一个带感叹号的破坏性变更标记(fix!:)。
HTTP层新增可选的对外HTTP/2支持,用于httpx客户端。流式处理有若干修复:Anthropic流式响应在message_delta事件缺少usage时也能容忍;Responses API流式桥接会处理空choices的分片;流式响应结束但没有usage时重新统计token。内容过滤改为对每个流式分片扫描有界窗口。
- 路由支持流式影子流量,silent_model可扇出多个目标
- 为托管OpenAI兼容模型发现token上限
- fallback目标重新检查预算(破坏性变更标记)
- httpx客户端可选用HTTP/2
- Anthropic流式容忍缺少usage的message_delta
- 流式响应缺少usage时重新统计token
成本核算与价格同步
Fireworks AI的缓存写入、推理和音频token改为通过共享成本计算器计费;xAI Responses API保留instructions,让系统消息在网页搜索后仍然存在;DashScope会把reasoning_effort转发给提供方;Bedrock Nova的InvokeModel路由支持提示缓存。
价格同步覆盖Azure、Azure AI、Gemini、OpenAI、Bedrock、Together AI、Fireworks和Vertex:278 个模型,59 个新增,30 个弃用。Gemini单独同步 22 个模型;Together AI单独同步 6 个模型、6 个弃用,但那一批同步中Google Gemini部分标记为失败。
- Fireworks AI缓存写入、推理和音频token走共享成本计算器
- xAI Responses API保留instructions以保住系统消息
- Bedrock Nova的InvokeModel路由支持提示缓存
- 价格同步 278 个模型,59 个新增、30 个弃用
- Gemini同步 22 个模型;Together AI 6个模型、6 个弃用
- Together AI那一批同步中Google Gemini部分失败
其他修复与Rust重构
代理侧修复包括:/anthropic直通不再把LiteLLM虚拟密钥转发给Anthropic;管理端模型访问被拒的错误里隐藏模型白名单;AWS Secrets Manager在密钥别名变更时重命名机密;Bedrock agent-runtime直通不再转发LiteLLM凭据头。
MCP相关改动包括:JWT OAuth凭据持久化需要授权;上游凭据缺失时失败关闭;健康发现限制在虚拟密钥授权范围内;管理端静态头计为api_key凭据槽位;工具执行期间保留按请求选择的护栏。
Rust侧继续拆分:抽出auth和cache crate,新增Redis缓存crate脚手架、独立framing crate,并映射Anthropic Messages转换;同时移除了gateway、config、router、realtime以及Rust trace对齐插桩。发布说明中这条移除未展开说明原因。
- /anthropic直通不再转发LiteLLM虚拟密钥
- 模型访问被拒错误中隐藏模型白名单
- AWS Secrets Manager在密钥别名变更时重命名机密
- MCP上游凭据缺失时失败关闭,健康发现限制在虚拟密钥授权内
- Rust拆出auth、cache crate,新增Redis缓存和framing crate
- 移除gateway、config、router、realtime及Rust trace对齐插桩