模型xAI / Grok·原文 2026年9月18日本站收录 2026年9月22日

xAI发布Grok Voice Transcribe 2.0,称准确率是上一代两倍且价格不变

xAI称新模型在Artificial Analysis流式模型准确率榜单位列第一,短语音命令的词错误率从 20.6% 降至 6.8%,批量转写维持每小时 0.10 美元。

xAI发布语音转文字模型Grok Voice Transcribe 2.0。xAI称,在其真实场景评测中,该模型是当前最准确的转写模型之一,准确率是Grok Voice Transcribe 1.0的两倍,价格与 1.0 相同。

据xAI介绍,Grok Voice Transcribe 2.0建立在支撑Grok Voice的音频基础模型之上。Grok Voice目前每天支持数万通客服电话,转写数百万小时视频旁白,并在实体产品中运行语音代理,包括特斯拉车辆中的Grok助手。该模型使用在多种环境中录制的实时、嘈杂、多语言音频数据集训练,并经过后训练优化。

准确率:流式榜单位列第一,电话音频领先测试模型

xAI称,多数转写模型在干净的单人音频上表现良好,但真实音频更难:线路不稳定的电话、多人同时说话、地方口音、以及念出电话号码或邮箱地址。xAI表示Grok Voice Transcribe 2.0是为各种条件和环境下最难的音频构建的。

在公开的Artificial Analysis排行榜上,xAI称Grok Voice Transcribe 2.0在 32 个流式模型中的准确率排名第一。

除公开基准外,xAI用取自生产流量的四个内部数据集衡量词错误率:客服通话的电话音频、与Grok的对话、口述凭证(如账号代码和邮箱地址)、以及简短的多语言语音命令。xAI称,2.0 在全部四个数据集上都优于 1.0,在电话音频上领先其测试过的所有模型。

多语言:短句词错误率从 20.6% 降至 6.8%

xAI称Grok Voice Transcribe 2.0可转写数十种语言,自动检测语言,并在单次处理中跟随录音中途的语言切换。xAI表示,多语言准确率是相对 1.0 最大的改进。

xAI指出,车载命令这类短语留给模型判断语言的上下文很少。在其短句数据集上,词错误率从 20.6% 降至 6.8%。

功能:现有API集成无需改代码即可获得准确率提升

xAI列出Grok Voice Transcribe 2.0支持的高级配置和控制项:批量与流式转写;词级时间戳;说话人分离;多声道转写;关键术语偏置;文本格式化;填充词移除;以及面向语音代理的智能轮次检测。

xAI表示,现有的语音转文字API集成无需修改代码即可获得准确率提升。

  • 批量与流式:可转写录音文件和URL,也可实时转写音频流。
  • 词级时间戳:每个词有精确的开始/结束时间和置信度分数。
  • 说话人分离:为转写文本中的每个说话人打标签,不额外收费。
  • 多声道转写:最多可独立转写 8 个声道。
  • 关键术语偏置:每次请求最多传入 100 个领域术语,如产品名称或医学术语。
  • 文本格式化:数字、日期、货币、电话号码和邮箱地址以书面形式返回。
  • 填充词移除:从转写文本中省略“um”“uh”等填充词。
  • 智能轮次检测:检测说话人轮次结束,供语音代理使用。

Atlassian Loom采用,称转写更准确

xAI称,Atlassian的Loom被广泛用于录制和分享屏幕录制。Atlassian发现Grok Voice Transcribe 2.0在转写Loom视频时比其现有解决方案更准确。

xAI描述了一种工作流:在Loom中录制行动计划,把转写文本接入Cursor,由Cursor直接生成代码改动。

Atlassian团队协作产品集合高级副总裁Sanchan Saxena表示:“我们一直相信,推动工作前进的最佳方式是捕获一次上下文,并让它流动到各处。由Grok驱动Loom的语音转文字、Cursor把它转化为代码,我们正在闭合从上下文到代码的环路:录下你的意图,工作就会被完成。这让人一窥AI辅助开发的方向。”

价格与迁移:维持原价,1.0 将在数周内弃用

xAI称Grok Voice Transcribe 2.0的定价与 1.0 完全相同:批量转写为每小时音频 0.10 美元,流式为每小时 0.20 美元,说话人分离、时间戳和关键术语均包含在内。

xAI表示,Grok Voice Transcribe 2.0很快将成为语音转文字API的默认版本,Grok Voice Transcribe 1.0将在未来几周内弃用。若要在此期间继续使用 1.0,需固定使用grok-voice-transcribe-1.0。

信息来源

xAI / Grok原始来源