模型Cohere Blog·原文 2026年9月10日本站收录 2026年9月11日

Cohere发布North Small Translate:218B总参数MoE翻译模型,WMT26平均得分 83.6

该模型以CC BY-NC 4.0许可开放权重,支持 50 多种语言,最低可在单张B200或两张H100上以W4A4量化运行。

AI解读:Cohere推出了North模型家族里的第一个翻译专用模型North Small Translate。它是一个总参数 218B、激活 25B的混合专家模型,支持 50 多种语言,权重已在Hugging Face开放下载,但只限研究和非商业用途。

这件事的特别之处在于Cohere把翻译做成了“专用件”,而不是拿通用大模型顺手兼职。Cohere给出的WMT26全语言平均分是 83.6,高于DeepL NextGen的 81.37、Gemma 4 31B(on)的 79.46 和Google Translate的 68.20;一个能自己找错并改错的Agentic版本得分 84.36。

真正受影响的可能是两类人。一类是做企业级翻译和本地化的团队:Cohere称商业授权版本每任务成本约 0.000676 美元,平均只用 661 个token,长文档评测得分 48.9,是Google Translate(21.3)和Gemma 4 31B(19.4)的两倍多。另一类是需要在本地或私有环境跑翻译的机构:模型最低配置是单张B200或两张H100,这比跑一个通用大模型现实得多。

不过要注意边界。评测由Cohere自己发布,WMT26分数用的是GPT-5.6-Sol当裁判,长上下文和吞吐数据也来自内部测试;非商业许可意味着企业不能直接拿开源权重上线,Cohere给出的出路是走RWS的Language Weaver产品。所以这不是“免费翻译模型来了”,而是“翻译质量的专用模型赛道又多了一个玩家,而且它瞄准的是私有部署”。

Cohere发布North Small Translate,这是该公司North模型家族中的首个翻译模型,采用混合专家(MoE)架构,总参数 218B、激活参数 25B,支持 50 多种语言,上下文长度为 16k输入 / 16k输出,输入输出均为文本。模型权重已在Hugging Face开放下载,提供多种近无损量化版本,并可在线试用与查看部署指南。

许可证为CC BY-NC 4.0,仅限研究和非商业用途。Cohere称,需要安全、可扩展的翻译与本地化平台的企业用户,可通过RWS的Language Weaver产品获得该模型。

最低硬件要求为 1 张B200(W4A4量化)或 2 张H100(W4A4)。

WMT26全语言平均分 83.6,超过DeepL NextGen与Google Translate

Cohere引用WMT26基准测试称,North Small Translate在所有语言上的平均得分为 83.60。对比对象包括Qwen 3.5 397B A17B(81.56)、GLM 5.2 FP8(76.50)、DeepL NextGen(81.37)、Gemma 4 31B(on,79.46)和Google Translate(68.20)。Cohere表示,该评测使用GPT-5.6-Sol作为裁判。

Cohere还提供了“Agentic”版本,即能够在翻译中查找并修复错误的版本,得分更高,为 84.36。

按WMT评分方法,80-100 对应“完美或仅有轻微错误”,60-80 为“良好但存在重大错误”,40-60 为“可接受”。Cohere称North Small Translate在 32 种高资源语言和 18 种其他语言上表现稳定,没有出现同尺寸模型常见的区域性大幅下滑。

  • WMT26全语言平均分:North Small Translate 83.60;Agentic版 84.36
  • Qwen 3.5 397B A17B 81.56;GLM 5.2 FP8 76.50;DeepL NextGen 81.37;Gemma 4 31B(on)79.46;Google Translate 68.20
  • 评测裁判:GPT-5.6-Sol
  • Cohere称该模型是同评测中表现最好的专用机器翻译模型,涵盖开源与闭源

分区域表现:欧洲领先Gemma,南亚基本持平,非欧洲区域均超DeepL

Cohere给出的区域平均分显示,在欧洲,North Small Translate以 82.2 对 73.9 明显领先Gemma 4 31B(on);在南亚则基本持平,86.2 对 86.7。

细分到欧盟语言,Agentic版 82.74、标准版 82.17,Gemma 4 31B(on)为 72.73;非欧盟欧洲语言,Agentic版 81.52、标准版 81.24,Gemma 4 31B(on)为 75.90。南亚区域,Agentic版 87.13、标准版 86.16,Gemma 4 31B(on)为 88.04。

Cohere称,两个版本在中东与北非、南亚、东南亚和东亚等所有非欧洲测试区域均超过DeepL NextGen:南亚和中东与北非领先约 8 至 10 分,东南亚领先约 4 至 5 分,东亚领先最少,约 1 至 3 分,标准版正接近DeepL的 85.41 分。

  • 欧洲:82.2 vs. Gemma 4 31B(on)73.9
  • 南亚:86.2 vs. Gemma 4 31B(on)86.7
  • 欧盟语言:Agentic 82.74 /标准 82.17 vs. 72.73
  • 非欧盟欧洲语言:Agentic 81.52 /标准 81.24 vs. 75.90
  • 非欧洲区域均超DeepL NextGen,东亚优势最小(约 1-3 分)

吞吐与长文本:输出吞吐最高为Gemma 4 31B的 1.4 倍

Cohere称,在相同并发水平和硬件配置下,North Small Translate的输出吞吐量最高可达Gemma 4 31B TP1(单GPU)的 1.4 倍。低并发下为 112 对 81 输出token/秒,高并发下为 39 对 30 输出token/秒。Cohere表示,这意味着每秒多生成 30% 至 38% 的token,长输出的完成时间更快。

在长上下文评测中,North Small Translate得分为 48.9,Cohere称是Google Translate(21.3)和Gemma 4 31B(19.4)的两倍多,并领先所有受测的通用大模型。该评测要求模型在一次调用中翻译一本书的两个章节,用xComet-XL逐段评估质量。

  • 吞吐:低并发 112 vs. 81 token/秒;高并发 39 vs. 30 token/秒(对比Gemma 4 31B TP1)
  • Cohere称吞吐提升相当于每秒多生成 30%-38% 的token
  • 长上下文评测:48.9 vs. Google Translate 21.3、Gemma 4 31B 19.4
  • 长上下文评测方式:单次调用翻译两章书籍,按段用xComet-XL评估

每任务成本约 0.000676 美元,比Gemini 3.1 Pro Preview低 5,762%

Cohere称,商业授权版本以每任务 0.000676 美元的成本获得 80.1 分,平均只使用 661 个token。Cohere表示,Gemini 3.1 Pro Preview(high)的每任务成本为 0.038928 美元,比North Small Translate贵 5,762%。

Cohere还列出了同尺寸模型的成本:Qwen 3.5 397B A17B每任务 0.004525 美元,Cohere自家的Command A+为 0.005158 美元。Cohere称价格数据来自各模型提供商官网的按token或字符计价。

  • North Small Translate商业版:80.1 分,每任务 0.000676 美元,平均 661 token
  • Gemini 3.1 Pro Preview(high):每任务 0.038928 美元,Cohere称贵 5,762%
  • Qwen 3.5 397B A17B:每任务 0.004525 美元
  • Command A+:每任务 0.005158 美元

与RWS合作开发,企业版走Language Weaver

Cohere称North Small Translate与RWS合作开发,RWS是一家语言技术与服务公司。Cohere表示,与RWS旗下Language Weaver的研究、科学团队及语言专家的紧密协作,在开发过程中帮助塑造了模型的真实世界翻译表现。

Cohere称RWS服务全球前 100 品牌中的 80% 以上。需要超出开放权重研究访问权限的企业,可通过RWS的Language Weaver产品获得North Small Translate。

Cohere表示,模型已在Hugging Face上线,供非商业与研究使用,文档中提供详细规格、部署指南和实现示例。

  • 开发合作方:RWS,尤其是Language Weaver的研究与语言团队
  • 企业通道:RWS的Language Weaver产品
  • 开放权重获取:Hugging Face,仅限非商业与研究用途
  • 许可:CC BY-NC 4.0

信息来源

Cohere Blog原始来源