模型DeepSeek官方公告·原文 2026年9月10日本站收录 2026年9月11日

DeepSeek发布V4.1-Flash:552B MoE,输入仅激活 8B,KV缓存降至上代 1/4 HBM

DeepSeek上线新架构家族最小模型V4.1-Flash,采用因果编码器—解码器与非对称架构,输入 8B、输出 16B激活参数;官方称多项测试中其性能、成本、速度与总运行时间均超过V4-Pro,并将逐步停用V4-Pro。

AI解读:DeepSeek把新架构家族里最小的模型V4.1-Flash直接放上了API,模型名deepseek-flash,原生支持多模态。它的卖点不是堆参数,而是把“算得动”这件事拆开:总参数 552B的MoE,真正参与计算的输入侧只有 8B、输出侧 16B,官方称这种非对称架构可以做到更高智能、更低成本。

对经常跑agent的人来说,最实际的数字是缓存。官方说V4.1-Flash的KV缓存只需要上一代的四分之一HBM和八分之一SSD存储,而缓存命中费用在agent成本里占比往往不小,压缩缓存就意味着这部分账单会明显下降。API新价格从 2026 年 9 月 10 日 04:00 UTC生效,保留峰谷定价,非高峰费率为高峰的一半。

官方还放出一句很重的话:多方测试显示V4.1-Flash在性能、成本、速度和总运行时间上领先V4-Pro,并因此开始淘汰V4-Pro。从 2026 年 9 月 14 日 04:00 UTC起,所有deepseek-v4-pro请求会按V4.1-Flash的费率路由到V4.1-Flash,直到V4.1-Pro发布。原有V4-Flash与V4-Flash-Vision-Exp已退役,旧模型名暂时兼容转发。

目前的限制也来自官方口径:这些“领先”说法没有给出具体评测数字和第三方复现细节,实际效果仍取决于接入方自己的任务。模型权重已在Hugging Face公开,配套技术报告同步放出;WorkBuddy(含CodeBuddy)和OpenCode宣布完整支持。DeepSeek同时表示会和开源社区合作推进推理支持,并接洽 2000 GPU加存储集群的大规模部署需求。

DeepSeek发布DeepSeek-V4.1-Flash,并已上线DeepSeek API,调用时把模型设为deepseek-flash。官方称这是其新架构家族中参数规模最小的模型,原生支持多模态。

激活参数与架构:552B MoE,输入 8B、输出 16B

官方公告称,V4.1-Flash是一个 552B参数的MoE模型,采用新的因果编码器—解码器(Causal Encoder–Decoder)架构,以及“非对称架构”:输入侧仅激活 8B参数,输出侧激活 16B参数。

DeepSeek表示,新预训练方法加上更大规模的强化学习后训练,使V4.1-Flash的基准测试结果领先旗舰模型,包括DeepSeek-V4-Pro。

  • 模型:552B参数MoE
  • 架构:新因果编码器—解码器;输入 8B激活参数,输出 16B激活参数
  • 训练:新预训练方法 + 更大规模RL后训练
  • 官方称基准结果领先V4-Pro等旗舰模型
  • 模型权重与论文已发布在Hugging Face

KV缓存:HBM降至上代 1/4,SSD降至 1/8

官方称相比上一代,V4.1-Flash的KV缓存只需要四分之一HBM和八分之一SSD存储。公告提到,缓存命中费用往往在agent成本中占很大比重,压缩缓存可以显著降低这部分成本。

定价与旧模型迁移

新定价于 2026 年 9 月 10 日 04:00 UTC生效。峰谷定价继续用于平衡需求,非高峰费率为高峰费率的 50%,官方建议把弹性工作负载安排到非高峰时段以节省费用。

V4-Flash和V4-Flash-Vision-Exp已退役。为兼容旧调用,deepseek-v4-flash和deepseek-v4-flash-vision-exp会暂时路由到V4.1-Flash。

官方称多方测试显示V4.1-Flash在性能、成本、速度和总运行时间上均领先V4-Pro,因此正在逐步淘汰V4-Pro。从 2026 年 9 月 14 日 04:00 UTC起,所有deepseek-v4-pro请求将按V4.1-Flash的费率路由至V4.1-Flash,直到V4.1-Pro发布。

  • 新价格生效:2026-09-10 04:00 UTC
  • 非高峰费率为高峰的 50%
  • V4-Flash与V4-Flash-Vision-Exp退役,旧模型名暂时转发
  • 2026-09-14 04:00 UTC起deepseek-v4-pro请求路由至V4.1-Flash,按V4.1-Flash费率计费

生态与部署

官方合作伙伴WorkBuddy(含CodeBuddy)和OpenCode已完整支持V4.1-Flash。DeepSeek表示将与开源社区合作推进V4.1-Flash的推理支持,并探索更多部署选项;对 2000 GPU加存储集群的大规模部署需求,官方邀请进一步沟通。

信息来源