开源Mistral News·原文 2026年10月6日

Mistral发布Mistral Large 4公开预览:1 万亿参数原生多模态,权重月底开源

Mistral称ML4是迄今最大最强的模型,已在Mistral Studio提供预览API,权重将于本月底发布;训练使用 3,800 块NVIDIA Grace Blackwell GPU,在Mistral自有的欧洲数据中心完成。

AI解读:部署与训练放在欧洲主权叙事下:官方称模型从零训练于 3,800 块NVIDIA Grace Blackwell GPU,运行在Mistral自有的欧洲数据中心,预览API也由同一基础设施提供服务,并包含一个由Mistral端到端运营、不受其他数字服务提供商影响的欧洲部署。

在发布权重前,Mistral称正与网络安全负责人、经审核的合作伙伴和国家主管部门进行真实场景红队测试,这些对象可访问同一模型但审核更少、网络能力扩展。

模型能力集中于编程、智能体工作流和多模态理解。官方数据显示,ML4在DeepSWE v1.1得分 61.7%、SWE-Atlas-QnA得分 59.4%、Terminal-Bench 4得分 28.3%,综合Coding Agent Index为 49.8%;在AutomationBench的 657 个业务工作流上得分 59.9%。

在AI解读层面,这篇稿件给出的最具体边界是网络安全场景中的拒绝率差异:Mistral称部分闭源模型在漏洞复现测试中因拒答而接近零分,而ML4在该测试得分 82%,并在Cybench的 40 项挑战中解决 93%;但这一比较基于Mistral引用的评测与内部测试,不能据此推断其在真实安全运营中的全面优势。

开源时点和后续信息仍需等待:Mistral表示将在本月底发布权重,并公布模型架构、更多基准和后训练方法的细节;目前公开的多数能力数字来自Mistral自述或第三方评测的转述,尚未提供公开可复现的完整评测材料。

Mistral今日发布Mistral Large 4(非正式名称为ML4)的公开预览,称其为 1 万亿参数、原生多模态模型,激活参数 490 亿。预览API已在Mistral Studio开放,权重将于本月底发布。

模型规格与发布安排

Mistral称ML4是其迄今最大且最强的模型。官方描述显示,该模型参数规模为 1 万亿,激活参数 490 亿,原生多模态。公司称其性能仍在快速提升。

发布节奏上,目前是公开预览,用户可在Mistral Studio试用预览API。Mistral表示本月底将释出权重,届时会一并公布模型架构、更多基准和后训练方法的细节。在此之前的红队测试阶段,网络安全负责人、经审核的合作伙伴和国家主管部门可访问同一模型,但审核限制更少、网络能力有所扩展。

Mistral将ML4定位为新一代专用与优化模型的基础,称其将服务于客户最关心的行业和工作负载。

  • 1 万亿参数,激活参数 490 亿,原生多模态
  • 预览API已在Mistral Studio开放
  • 权重定于本月底发布
  • 红队阶段向网络安全负责人、审核伙伴和国家主管部门开放减少审核、扩展网络能力的同一模型

训练设施与主权叙事

Mistral称ML4从零训练于 3,800 块NVIDIA Grace Blackwell GPU,位置是Mistral自有的欧洲数据中心;公开预览也由同一基础设施提供服务。

官方强调欧洲主权,称模型将在多个地区提供,其中包括一个由Mistral端到端运营的欧洲部署,独立于其他数字服务提供商,并受欧洲法律约束。Mistral还称训练数据中有很大一部分是多语言的,覆盖 160 多种语言,包括欧盟所有官方语言。

Mistral表示,ML4使用的训练、定制和RL环境与通过Mistral Forge向客户提供的环境相同。公司提到正在与金融、工程、制造、物流、制药、科学、航运、公共部门等行业的企业合作训练该模型。

  • 从零训练于 3,800 块NVIDIA Grace Blackwell GPU
  • 训练与预览服务均运行在Mistral自有的欧洲数据中心
  • 含一个Mistral端到端运营的欧洲部署
  • 训练数据覆盖 160 多种语言,包括欧盟所有官方语言

能力与评测数据:网络安全、编程与工作流

网络安全是Mistral重点展示的能力。公司称ML4在Artificial Analysis Cyber Index上位列全球前五,并大幅领先非中国开发的开放权重模型。在该指数的一项测试中,模型需要复现开源软件中的真实漏洞并修补,ML4得分 82%,Mistral称这是所有模型中最高。在Cybench的 40 项安全竞赛挑战中,Mistral称ML4解决 93%,是开放权重模型中的最高分之一。

Mistral特别指出拒绝率差异:其称包括Claude Opus 5.5和GPT-6 Astra在内的若干领先闭源模型在同一测试中因拒绝执行任务而接近零分。Mistral主张防御软件常常需要先证明漏洞真实存在,而这正是闭源模型的安全过滤可能阻止的工作。公司还称在内部测试中,ML4对分析恶意软件、漏洞优先级排序和编写检测规则有用,并可在私有云或本地运行。

编程方面,Mistral公布ML4在DeepSWE v1.1得分 61.7%、SWE-Atlas-QnA得分 59.4%、Terminal-Bench 4得分 28.3%,综合Coding Agent Index为 49.8%,超过DeepSeek V4 Pro 0813和Qwen3.8 Max。公司还称与Surge AI进行了盲测人工评估,专业标注员在隐藏模型身份的情况下按 1–5 分打分,ML4 Preview在五个模型中排名第二(3.74),排在其后的是Kimi K3(3.59)、GLM-5.3(3.60)和GLM-5.2(3.40),仅低于Claude Opus 5(4.22)。

智能体工作流方面,Mistral称ML4可在Gmail、Google Sheets、Slack、Salesforce等应用间处理复杂流程,在包含 657 个业务工作流的AutomationBench上得分 59.9%,超过Kimi K3、MiMo-V2.6-Pro和DeepSeek V4 Pro。在评估长周期知识工作的AA-Briefcase上,其Elo达到 1,393,超过DeepSeek V4 Pro。

  • 网络安全:Artificial Analysis Cyber Index全球前五;漏洞复现与修复测试得分 82%;Cybench 40项挑战解决 93%
  • Mistral称部分闭源模型在漏洞复现测试中因拒答接近零分
  • 编程:DeepSWE v1.1 61.7%;SWE-Atlas-QnA 59.4%;Terminal-Bench 4 28.3%;Coding Agent Index 49.8%
  • 人工盲评:ML4 Preview五模型排名第二(3.74),低于Claude Opus 5(4.22)
  • 智能体:AutomationBench 657个业务工作流得分 59.9%;AA-Briefcase Elo 1,393

多模态、科学与知识工作

多模态方面,Mistral称ML4能推理复杂文档、图表和自然图像,并将视觉与智能体能力结合,例如检查千兆像素卫星图像、分析工程图纸。在视觉grounding的Dense 200上,Mistral称ML4以 42% 对 41% 超过GPT-6-Astra。

科学与数学方面,Mistral称ML4在开放权重模型的SciCode-Verified上达到最优,并能一次性生成完整的Hartree–Fock模拟。公司称在内部人类评估中,ML4在STEM任务上表现优于GLM-5.3,数学推理更精确、更有结构,并能持续处理长程应用数学任务。

知识工作方面,Mistral称ML4在第三方评估机构vals.ai的法律和金融代表性任务上均超过GPT-6-Astra;在HarveyAI的法律Agent基准上超过所有开源模型。Mistral还提到FinWorkBench用于测试模型创建和编辑电子表格的能力,并展示了多步公司金融挑战的演示。

  • Dense 200视觉grounding:ML4 42%,GPT-6-Astra 41%(Mistral数据)
  • SciCode-Verified:开放权重模型中Mistral称为最优
  • 知识工作:vals.ai法律与金融任务超过GPT-6-Astra(Mistral引用)
  • 法律:HarveyAI Legal Agent基准上超过所有开源模型(Mistral引用)

安全与后训练规模

模型安全方面,Mistral称ML4已在间接提示注入鲁棒性基准上饱和,处于开源模型前沿。在Lakera公开的B3 AI安全基准上,ML4抵御了 93.3% 的攻击,Mistral称未见到竞争对手有更高分数。在KORA基准上,ML4得分为 1.691(最高 2,表示Exemplary),是Mistral在开源模型中测得的最高分。

Mistral还称ML4在JailbreakBench、StrongREJECT和AgentHarm的网络安全相关提示上平均拒绝率高于所有开源模型。

后训练方面,Mistral称其RL库支持在单次训练中组合单轮聊天、科学问题求解、安全对齐、事实性和长程工具使用等任务,并共享代码沙箱、网络搜索和外部API等资源。公司称当前规模为 3 千块GPU,单次训练每天产生约 330 亿token,其中过滤和掩码后约 160 亿为可训练补全token。

Mistral称该RL运行仍在进行中,模型未见饱和迹象,随着基础设施扩展,预计未来数周至数月会有大幅快速改进。公司还提到ML4是其 30 亿欧元D轮融资支持路线图上的第一个里程碑,该轮被称为欧洲科技公司有史以来最大股权融资。

  • Lakera B3:抵御 93.3% 攻击,Mistral称无竞争者更高
  • KORA基准:1.691,最高为 2,Mistral称为开源模型中最高
  • 网络安全提示拒绝率:Mistral称高于所有开源模型
  • RL规模:3 千块GPU,单次训练每日约 330 亿token,约 160 亿可训练token
  • 资金:30 亿欧元D轮,Mistral称为欧洲科技公司最大股权融资

信息来源

Mistral News原始来源