Cohere发布Embed 5嵌入模型家族,Pro与Fast共用同一向量空间
Embed 5 Pro与Fast即日起在Cohere API、Model Vault、Microsoft Foundry和Amazon SageMaker上线,每百万token定价分别为 0.12 美元和 0.08 美元,两档模型共用同一嵌入空间,可用Pro建索引、Fast查询而无需重建索引。
AI解读:Cohere一次性放出两档嵌入模型,思路很直接:把检索质量和线上延迟拆成两笔账分别算。Pro用于离线建索引和复杂文档的高质量检索,Fast用于实时搜索、智能体循环这类高频查询路径,企业可以按场景各选一档。
真正有工程价值的不是跑分,是两档共用同一嵌入空间。文档用Pro建库、查询用Fast也能直接比对,不用重建索引;Cohere在 40 个开发数据集上测得跨模型组合相对同模型基线平均只损失 1.6% 和 2.7%。对已经被重索引折磨过的团队,这才是省事的地方。
多模态和金融文档是这次主打的强项。Pro在ViDoRe V3上平均 86.1,比Embed 4提升 8.8 分;解析PDF套件平均 84.8,财务基准FinanceBench为 80.1。Cohere特别指出,多数企业检索管线仍先做PDF转文本,表格的行列关系、多栏阅读顺序和图表很容易丢,而这正是这批基准想覆盖的场景。
成本方面有两点可算:一是价格,Fast比Pro便宜三分之一;二是向量存储,Embed 5支持Matryoshka和低精度输出,2048 维float32需要 8 KB,1024 维int8只需 1 KB,256 维二进制仅 32 字节,一亿条向量的原始存储可从约 819 GB降到 3.2 GB。Cohere称int8在Pro和Fast上都接近全精度检索质量,多数部署推荐 1024 维int8。
需要注意的是,所有性能数字均来自Cohere自测和其选定的基准,RCP-nDCG@10 也是其提出的新评测方法,与其他厂商常用的nDCG@10 不完全可比,实际效果仍需在自家语料上验证。此外Compass Cloud仅处于私有测试阶段。
Cohere发布Embed 5嵌入模型家族,分为Embed 5 Pro和Embed 5 Fast两档,定位分别是最高检索质量和面向延迟、成本敏感的高并发负载。Cohere称Embed 5是其迄今检索性能最强的模型,即日起在Cohere API和Model Vault、Microsoft Foundry、Amazon SageMaker上线。
定价为Embed 5 Pro每百万token 0.12美元,Embed 5 Fast每百万token 0.08美元。两档模型上下文长度均为 128K token,支持文本、图像以及文本与图像的融合输入,覆盖 100 多种语言,输出维度可选 2048、1536、1024、768、512、256,嵌入格式支持float、int8和binary,均支持Matryoshka嵌入、共用同一嵌入空间并支持自托管。
ViDoRe V3平均 86.1,财务基准Pro领先
Cohere称Embed 5 Pro在其测试的所有模型中取得最高平均分,覆盖ViDoRe V3、财务文档、解析版PDF、图像检索以及主要商业语言。
在ViDoRe V3上(该基准的文档取自财务申报、技术手册、监管材料、政府报告、教科书和讲座等企业领域),Embed 5 Pro平均 86.1,比Embed 4提升 8.8 分。Cohere列出的对比数字为:Voyage 4 Large 83.7、Gemini Embedding 2 83.2、OpenAI text-embedding-3-large 75.3。Pro在其中 8 个领域中有 5 个领先,并在能源领域与Voyage 4 Large持平,相对Embed 4增幅最大的是人力资源(+11.4)和工业(+10.3)。Embed 5 Fast平均 84.7,也高于Gemini Embedding 2和Voyage 4 Large。
财务文档方面,Cohere称Pro在三个公开财务基准上排名第一,Fast尽管体量小得多也在每一项排名第二:FinanceBench为Pro 80.1、Fast 80.0;FinQA为 90.0、88.8;ViDoRe V3 Finance为 85.0、83.9。Cohere表示Pro在这几项上平均比排名最高的非Cohere竞品Gemini Embedding 2高 3.3 分,相比OpenAI text-embedding-3-large在FinanceBench上的领先扩大到 21.4 分。
- ViDoRe V3:Embed 5 Pro平均 86.1,Embed 4为 77.3(按提升 8.8 分推算),Voyage 4 Large 83.7,Gemini Embedding 2 83.2,OpenAI text-embedding-3-large 75.3
- FinanceBench:Pro 80.1,Fast 80.0
- FinQA:Pro 90.0,Fast 88.8
- ViDoRe V3 Finance:Pro 85.0,Fast 83.9
解析PDF与多模态检索
Cohere指出,多数企业检索管线在嵌入前仍会把PDF转成文本,但这一过程会破坏结构:表格丢失行列关系,多栏布局打乱阅读顺序,重复页眉引入噪声,图表往往完全消失,因此解析文档检索比干净文本基准更难。
其解析文档套件涵盖服务文档、公司报告、SEC申报文件、产品手册和隐私政策。Embed 5 Pro在该套件上平均 84.8,领先Voyage 4 Large的 83.6、Embed 5 Fast的 83.4、Gemini Embedding 2的 80.8 和Embed 4的 78.6。Cohere称Pro在以FinanceBench和CoFiF为代表的财务文档上尤其强。
部分文档更适合以视觉方式表示,例如扫描页、幻灯片、示意图和图表,其中信息可能被文本抽取遗漏。Embed 5可直接嵌入页面图像,也可把图像与其元数据合并成单一向量。在融合文本图像语料上,Pro在 5 个数据集上平均 82.3,高于Fast的 81.2 和Gemini Embedding 2的 61.3,Cohere称Pro在该套件每个数据集上都优于Gemini Embedding 2。页面图像检索上,Pro在财务数据集上平均 77.0,领先Fast的 73.2、Embed 4的 71.1、Voyage Multimodal 3.5的 70.1 和Gemini Embedding 2的 56.7。
- 解析文档套件:Pro 84.8,Voyage 4 Large 83.6,Fast 83.4,Gemini Embedding 2 80.8,Embed 4 78.6
- 融合文本图像(5 个数据集):Pro 82.3,Fast 81.2,Gemini Embedding 2 61.3
- 页面图像财务检索(5 个数据集):Pro 77.0,Fast 73.2,Embed 4 71.1,Voyage Multimodal 3.5 70.1,Gemini Embedding 2 56.7
多语言:欧洲语种平均 77,波斯语提升 12.8 分
Embed 5在 100 多种语言上训练,重点覆盖其全球客户最常用的语言。
在德语、法语、西班牙语、意大利语和俄语上,Cohere称Embed 5 Pro取得其所测模型中的最高平均分 77,Voyage 4 Large为 76,Gemini Embedding 2为 73。相比Embed 4平均提升约 7 分,增幅最大的是俄语(+9)和意大利语(+7)。
在另外十种语言上,Cohere称Pro相对Embed 4增幅最大的集中在中东和南亚语种,尤其是波斯语(+12.8)、泰卢固语(+12.3)和印地语(+11.5)。Cohere公布的分语言对比中,部分语种仍由竞品领先:日语Gemini Embedding 2为 90,Pro为 86.6;阿拉伯语Gemini Embedding 2为 86.5,Pro为 82.8;泰卢固语Gemini Embedding 2为 91.1,Voyage 4 Large为 88.6,Pro为 80.3。
- 欧洲五语平均:Pro 77,Voyage 4 Large 76,Gemini Embedding 2 73;Pro相对Embed 4平均提升约 7 分
- 提升最大语言:波斯语 +12.8、泰卢固语 +12.3、印地语 +11.5
- 分语言示例(Pro / Fast / Gemini Embedding 2):中文 82.4 / 80.3 / 80.7;韩语 85 / 83.2 / 87.3;印尼语 85.2 / 82.7 / 87.8;泰语 82 / 74.6 / 87.7
Fast的吞吐与跨模型组合实测
Cohere称Embed 5 Fast是面向延迟敏感、高并发检索的轻量模型,成本比Pro低三分之一,同时保留相同的 128K token上下文、多模态输入、多语言覆盖和多种压缩输出格式。
Cohere认为Fast的价值主要在查询路径上,因为每次搜索都要付嵌入延迟,在可能为单个任务发起数十次搜索的智能体工作流中还会成倍放大。较小的体量也降低私有部署的服务成本,并加快大规模摄入和重建索引。Cohere称在文档吞吐这一更接近索引效率的指标上,Fast在各类上下文长度上平均比Pro高 2.4 倍。
Fast的性能对比方面,Cohere称其在ViDoRe V3上领先Voyage 4 Nano超过 7 分,领先Jina Embeddings v5 Text Small、Perplexity和微软Harrier 0.6B达 10 分以上;尽管体量约为Qwen3-VL-Embedding-2B的一半,仍高出约 20 分。在解析PDF上Fast为 83.4,高于Gemini Embedding 2的 80.8,低于Voyage 4 Large的 83.6。
两档模型共用同一嵌入空间,因此任一模型的向量可直接比较。Cohere在覆盖文本、图像、融合和解析文档检索的 40 个开发数据集上测试了每一种语料与查询组合。Cohere称跨模型组合与同模型基线差距不大:Fast查询平均损失 1.6%,Pro查询平均损失 2.7%,且没有任何数据集出现明显失败。给出的建议部署模式是用Pro建索引、用Fast查询,以在请求阶段保留Fast的延迟和成本优势。Cohere给出的平均检索质量数字为:语料Fast/查询Fast 96.6,语料Fast/查询Pro 98.4,语料Pro/查询Fast 97.3,语料Pro/查询Pro 100。
- Fast相对Pro:成本低三分之一,保留 128K上下文、多模态、多语言和压缩输出格式
- 文档吞吐:Fast平均比Pro高 2.4 倍(约 200 token与约 1K token上下文长度)
- Fast在ViDoRe V3上领先Voyage 4 Nano超 7 分,领先Jina v5 Text Small、Perplexity、微软Harrier 0.6B达 10 分以上,高出Qwen3-VL-Embedding-2B约 20 分
- 跨模型组合损失:Fast查询平均 1.6%,Pro查询平均 2.7%;使用同一输出维度即可兼容,也兼容Matryoshka截断和int8量化
向量存储与部署方式
Cohere提出,在企业规模下向量索引的运营成本可能高于生成它的模型。Embed 5支持Matryoshka表示学习和更低精度输出,让团队压缩向量并控制质量、存储和搜索成本之间的权衡。
Cohere给出的存储数字为:2048 维float32向量需要 8 KB,1024 维int8向量使用 1 KB,256 维二进制向量仅 32 字节,相当于减少 256 倍。以一亿条chunk计算,原始向量存储可从约 819 GB降到 3.2 GB。Cohere称int8在Pro和Fast上都保留了接近全精度的检索质量,并推荐多数部署使用 1024 维int8向量;二进制占用最小但有一定精度损失,适合在更高精度重排之前做快速初筛。
部署渠道方面,Embed 5 Pro和Fast可通过Cohere API、Model Vault、Microsoft Foundry(Pro、Fast)和Amazon SageMaker使用,也可在North内直接使用。私有部署可在自有VPC或本地通过vLLM提供服务,批量嵌入面向大规模摄入。Cohere称Embed 5可接入现有检索栈,集成框架和向量数据库包括LangChain、Haystack、Weaviate、Qdrant、Pinecone、Elasticsearch、MongoDB、Redis、Milvus和OpenSearch。
Cohere同步公布了两项周边动态:将于 10 月 8 日举办网络研讨会,由搜索与嵌入负责人介绍Embed 5、Parse 5及其他准备中的产品;其托管搜索与检索平台Compass Cloud已进入私有测试,可申请接入。Embed 5的贡献者包括Samarth Bhargav、Fabian Schmidt、Clifton Poth、Arthur Maciejewicz、Florian Schneider、David Rau、Dennis Zhao、Timothy Ang、Nils Reimers和Carlos Lassance。
- 存储对比:2048 维float32为 8 KB,1024 维int8为 1 KB,256 维binary为 32 字节,减少 256 倍
- 一亿条chunk:原始向量存储从约 819 GB降至 3.2 GB
- 推荐配置:多数部署使用 1024 维int8;binary适合初筛后重排
- 可用渠道:Cohere API、Model Vault、Microsoft Foundry、Amazon SageMaker;私有部署支持vLLM
- 注意:性能数字来自Cohere自测;RCP-nDCG@10 为Cohere提出的评测方法,采用两阶段检索设置,反映的是重排质量而非第一阶段检索性能