当地时间 9 月 18 日,SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型。官方的说法是,错误率降低约一半,价格保持不变。
这款模型基于 Grok Voice 底层的音频基础模型构建。官方顺带交代了这套基础设施已经在跑的业务量,每天承接数万通客服电话,转录数百万小时的视频旁白,还驱动实体硬件里的语音智能体,其中包括特斯拉车辆上搭载的 Grok 助手。
价格表是这次最实的一块。批量转录每小时音频 0.10 美元,实时流式转录每小时 0.20 美元,与 1.0 版本完全一致。说话人分离、精确时间戳和自定义关键词都包含在内,不额外收费。
官方还给了两组成绩。一组是 Artificial Analysis 榜单,说它在全部 32 款流式模型里准确率第一。另一组是内部评测,SpaceXAI 从线上业务里采了四个数据集,分别覆盖客服电话音频、与 Grok 的日常英语对话、电话号码和邮箱地址这类口述信息、多语种简短语音指令,在四个数据集上全面超过 1.0 版本。
价格这一项我核对了,站得住。Artificial Analysis 的页面上给 Grok Voice Transcribe 2.0 标的价格是每一千分钟 1.67 美元,折算下来正好每小时 0.10 美元,与官方口径一致。
榜单这一项就不一样了。在那个页面的流式语音识别榜上,Grok Voice Transcribe 2.0 的词错误率是 2.29%,排在第五位。前四名分别是 Fun-Realtime-ASR-preview 的 1.73%、StepAudio 3 ASR 的 1.75%、MAI-Transcribe-2 的 2.04% 和 Scribe v2 的 2.18%。页面自己生成的结语里也写着,领跑者是 1.7% 的那个模型。
榜单存在多个口径,同一个页面上还有清理后错误率、非流式榜等不同视图,官方没说明「第一」依据的是哪一版、哪个语言集。所以这个说法现在只能按存疑处理,我没有找到能支持它的公开数据。
我觉得这份更新的真实看点不在榜单,在价格结构。
每小时 0.10 美元的批量价,折合人民币约 0.67 元。这个价位已经把语音转文本的降价空间压到很薄,一小时录音的机器成本低于一瓶矿泉水。价格战打到这里基本结束了,接下来比的只能是错误率,以及谁能拿到更贴近真实场景的音频。
这正好是 SpaceXAI 手里比较特别的一张牌。客服电话、车载语音、视频旁白,这些是它自己业务里长出来的音频分布,别人的公开数据集里没有。用自家流量做评测集,说服力比刷公开基准高,但它同时也有一个副作用,这类数据的错误率优势未必能平移到你的场景里。
对开发者来说,判断要不要换模型有个简单办法。拿你自己业务里最脏的一段音频,两家各跑一遍,比较专有名词、数字和口音的识别结果。榜单名次在这个环节帮不上忙。
更新时间:2026-09-21
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号