模型硅基流动官方博客·原文 2026年9月28日

DeepSeek发布V4.1 Flash:552B MoE、每token仅890字节KV缓存,V4 Flash旧别名已改路由

硅基流动官方博客介绍了DeepSeek V4.1 Flash的架构、基准、定价与迁移要点:该模型于2026年9月10日发布,采用非对称因果编码器-解码器,全局KV缓存降至每token 890字节,约为V4 Flash的四分之一;DeepSeek直连API的V4 Flash已退役,旧别名临时路由到V4.1。

AI解读:DeepSeek在2026年9月10日发布V4.1 Flash,这是V4.1家族中体量最小的已发布模型,但仍有552B参数主干和196B的Engram条件记忆。它面向编码智能体、长上下文推理和高并发工具调用,普通开发团队更现实的选择是走托管推理。

它真正解决的问题是长输入场景的成本:编码器每token只激活8B参数,解码器激活16B,全局KV缓存被压到每token 890字节,约为V4 Flash的四分之一。对反复读取大段代码或文档的智能体,这直接影响每次任务的花费。

基准提升集中在编码和智能体任务,供应商报告的最大推理强度成绩包括Codeforces 3471、Terminal-Bench 2.1 Pass@1 90.6、DeepSWE v1.1 74.2。但同一模型在不同脚手架下DeepSWE分数从65.5到74.2,说明上线前要测整套系统而不只是模型本身。

直连API的V4 Flash已退役,旧别名暂时指向V4.1,但迁移不能只改模型ID。提示行为、工具调用、推理长度、图片处理、延迟和每个被接受任务的成本都要重测;第三方提供商的模型ID、价格和支持参数各不相同。

定价按UTC工作日高峰与非高峰区分,非高峰非缓存输入每百万token 0.15美元、输出0.60美元,高峰翻倍。V4 Pro仍是独立选项,官方文档称其将在2026年9月14日后继续提供,是否保留取决于评测结果是否值回更高价格。

DeepSeek于2026年9月10日发布V4.1 Flash,这是其V4.1架构家族中体量最小的已发布模型,但仍有552B参数主干和196B参数的Engram条件记忆(来源:硅基流动官方博客,依据为官方模型卡与DeepSeek V4.1技术报告)。

模型采用40层非对称因果编码器-解码器:20层编码器以每token 8B激活参数处理输入,20层解码器以每token 16B激活参数生成输出。解码器的全局KV缓存从编码器最终隐藏状态投影而来,而非在每个解码层单独生成完整缓存,官方称全局KV缓存因此降至每token 890字节,约为V4 Flash的四分之一。

模型支持最多100万token上下文,DeepSeek直连API最多输出384K token;输入支持文本和图片,输出为文本。权重与仓库以MIT许可证发布,可商用、修改和自托管,但博客提醒“开放权重”比“开源”更准确,训练数据集和开发工件并未全部公开。

DeepSeek直连API的V4 Flash已退役,旧别名目前临时路由到V4.1 Flash,新的模型ID为deepseek-flash。博客强调改别名不应成为整份迁移计划。

定价按UTC时段区分:周一至周五01:00–04:00和06:00–10:00为高峰,其余为非高峰。以1000万非缓存输入token和200万输出token的假设负载计算,非高峰为2.70美元,高峰为5.40美元;缓存命中、重试和失败运行会改变总额。

V4 Pro仍是独立选项。虽然发布公告最初提到逐步淘汰,但DeepSeek当前文档称deepseek-v4-pro将在2026年9月14日后继续提供。

基准提升集中在编码与智能体任务,但脚手架影响很大

博客引用DeepSeek在最大推理强度下的instruct模型结果:Codeforces评分从V4 Flash的3289升至3471,Terminal-Bench 2.1 Pass@1从82.7升至90.6,DeepSWE v1.1解决率从54.4升至74.2,NL2Repo-Bench从54.2升至64.0,AutomationBench Pass@1从37.7升至54.8,Agent's Last Exam Pass@1从25.2升至31.8。

DeepSeek报告DeepSWE v1.1在同一模型的不同测试脚手架上得分在65.5到74.2之间,博客因此建议生产评测覆盖模型、提示格式、工具、沙箱、重试策略和验收标准的完整系统。

第三方Artificial Analysis测得该模型在最大推理强度下Intelligence Index v4.3得分为40,通过DeepSeek API的输出速度约每秒207 token;博客同时指出该模型使用的输出token数高于对比中位数,因此低token单价不保证每个完成任务的总成本最低。

原生多模态支持图片输入,但不生成图片

V4.1 Flash通过随语言模型训练的视觉编码器处理图文交错输入。DeepSeek报告的基础模型得分为MMMU-Pro 56.5、CVBench 77.9、DocVQA 95.6、RefCOCO-average 86.0。

这些结果支持文档阅读、图表解读、视觉定位和界面检查等用途,但不代表图像生成或编辑能力,模型只输出文本。博客提醒部署前要用应用实际会收到的视觉输入做测试,因为扫描表单、密集仪表盘、小号UI标签和自然照片的失败模式各不相同。

从V4 Flash迁移需要六步,缓存与图片要单独验证

  • 固定提供商和模型ID:DeepSeek直连API改用deepseek-flash,其他提供商使用各自文档中的ID。
  • 重测提示与工具:用代表性生产任务比较响应结构、工具调用成功率、推理长度和错误处理。
  • 设置成本边界:按任务价值限制上下文和输出,跟踪每个被接受结果消耗的token与重试。
  • 单独验证图片:在开启多模态流量前测试OCR、图表阅读、图片尺寸和低质量输入。
  • 影子流量:在切换主路由前测量被接受任务率、p95延迟、工具完成率和成本,保留旧配置以便回滚。
  • 博客称V4.1 Flash适合仓库级编码智能体、长上下文文档工作流、视觉文档与界面分析、高并发自动化;不可逆操作、安全决策和事实声明仍需验证和人工审批。

信息来源