SpaceXAI新版语音转文本模型亮相:错误率减半,价格不变
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,将错误率降低约一半,价格不变。该模型基于已嵌入真实业务(如客服电话、视频旁白、特斯拉车机)的底层音频基础模型,在多个数据集上全面超越旧版。其低错误率和零价格提升对开发者极具吸引力。
核心升级:错误率近乎折半
就在当地时间9月18日这个时间点, 由xAI这家公司所持有的人工智能部门, 正式地将Grok Voice 2.0这种把语音转写成文本的模型给推出来了。在这个新来的模型里面, 在各种各样的测试项目里头, 那些错误的数量比起之前那个叫做1.0版本的模型来说, 大概减少了百分之五十那么多。
特别是那种周围声音很大的场合, 它能把听到的东西认得更准了, 提升的那叫一个显著。根据xAI这家公司的官方公布出来的数据显示, 在这个新的2.0版本身上, 对于那些需要流动处理的模型测试基准来说, 它的准确率排在了第一名的位置, 把这个赛道上面其他的所有竞争对手都远远地甩在了身后。
业务落地:数百万小时真实语音打磨
Grok Voice 2.0是扎根在底层的音频基础模型之上的存在, 它已经深度嵌入到了xAI和特斯拉这两家公司的真实业务场景里。
这个模型每天要处理数万通客服电话, 还要转录数百万小时的视频旁白, 同时还驱动着特斯拉车机上的Grok助手这类硬件语音智能体在工作。xAI说, 这不是那种只会在实验室里跑分的模型, 它是经过海量的真实语音反复打磨后才出来的产物。

基准表现:公开榜单与内部测试双碾压
在xAI所发布的公开榜单当中, Grok Voice 2.0这个模型的表现是非常突出的, 因为它在总共三十二个流式模型里面, 把准确率排在了第一名的位置上, 因此就把同一赛道里的那些竞争对手通通甩在了身后, 而xAI这家公司还做了另一件事情, 就是从自身业务中抽取出了四个内部数据集, 这四个数据集分别涵盖了什么呢, 分别是客服录音、日常英语对话、结构化信息比如电话号码还有邮箱地址以及多语种短指令, 然后他们拿这些数据进行测试, 结果显示二号版本在所有这些数据集上面都实现了全面碾压一号版本的情况, 所以这种优势是非常明显的。
定价策略:加量不加价,功能全免费
最令开发者心动的地方在于价格没有发生任何变化, 批量转录的价格依旧保持为每小时音频0.10美元, 实时流式转录的价格依旧是每小时0.20美元, 这些收费标准与1.0版本的情况完全相同。
与此同时, 说话人分离功能、精确时间戳功能以及自定义关键词功能等高级特性, 现在统统都被包含在了基础价格之中, 不需要再进行单独收费。xAI做出这样的举动, 其目的是为了降低企业用户采用的门槛。此外, 这一举措还有助于扩大语音识别技术的应用范围。
开发者价值:高性价比撬动大规模落地

在语音识别这个行业里面, 价格是非常敏感的, 而且调用量是巨大的, 所以 Grok Voice 2.0 提出的“加量不加价”的这个策略就特别具有吸引力了。开发人员可以使用旧版的价格, 来获得那个错误率几乎减半的、功能也更多的新的模型。
xAI 表示, 这一套方案尤其适合客服中心, 还有会议转录, 视频字幕生成这样的一些场景, 因为这些场景中需要大规模的使用调用量, 这个方案能够显著地降低运营成本。
行业影响:或引发语音识别价格战
Grok Voice 2.0这款产品的发布, 可能会对现有的语音转文本行业造成不小的冲击。就目前来看, 市场上主要的竞争对手, 比如说以及这些产品, 它们的定价通常是高于每小时的0.10美元的。此外, 如果想要使用更高级的功能, 往往还需要额外支付费用。
然而, xAI提供的解决方案不仅能够以更低廉的价格实现更好的性能表现, 这就很可能迫使其他的相关厂商不得不跟随采取降价的措施, 或者去升级自身的产品功能。
可是, xAI这边把话放出来了, 他们觉得自己的优点不只在价格方面有吸引力, 更重要的地方在于, 经过实际业务场合的一番考验之后, 证明了自身所具备的稳定性。
在读完上面的这些文字内容之后, 你是否认为Grok Voice 2.0所采用的这种只增加量却不涨价的策略, 会导致其他的语音识别厂商不得不降低产品的价格呢? 非常欢迎你在评论区之中分享你自己的观点, 同时请给予点赞以及进行转发操作, 这样能够让更多的人了解到这项重要的进展。
登录后参与评论
评论仅开放给已登录并完成邮箱绑定的用户。
0
暂无评论。