跳到主要内容

阿里通义千问语音合成全球第一,16种语言自然度领先

32 0
AI摘要

阿里通义千问发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,推动语音合成从“能说话”迈向“会表达”。其Plus版本在权威榜单Speech Arena中斩获全球第一。模型包含Flash版(低延时)和Plus版(高质量),核心能力实现多语种方言覆盖升级、支持Free-style自然语言指令、细粒度标签控制、复杂声学鲁棒性增强等四大突破,显著提升语音

语音合成技术迎来代际跨越

近日, 阿里通义千问团队正式推出新一代实时语音合成模型Qwen – Audio – 3.0 – TTS, 这一发布意味着语音合成技术从基础的能够说话的阶段, 正式朝着具备情感以及表达的会说话阶段迈进, 此模型凭借卓越性能, 迅速在业界引发广泛关注。

阿里通义千问语音合成全球第一,16种语言自然度领先

已在全球权威的Arena榜单中斩获第一名的是其Plus版本, 在综合表现方面, 该模型将市场上主流的, 诸如.1TTS和v3等这些竞争对手都给超越了, 这一成绩不但体现出技术有着领先态势, 还证明了它在实际应用场景当中具备强大竞争力, 开发者能够期待迎来更为自然且更为高效的语音交互体验。

双版本策略满足多元场景

包含Flash、Plus两个版本的本次发布模型, 针对不同需求予以优化, Flash版主打实时交互, 首包延迟控制于约300毫秒, 这种超低延迟特性让其颇为适配对响应速度要求极高的如智能助手等低延时场景。

专为高质量声音生成所聚焦的Plus版, 在自然度之能力与音色还原度之呈现方面, 有着更为出色的表现。针对于那些对音质有着极为严苛之要求的场景, 像是录制有声书以及游戏配音这类, Plus版给出了更具优质性的解决方案。用户能够依据具体的业务需求, 以灵活之态去挑选最为适宜的版本, 从而进行接入以及使用。

多语种方言覆盖行业领先

关于语言方面所提供的支持, Qwen – Audio – 3.0 – TTS达成了很明显的提升, 它能够对全球十六种主要语言开展语音合成, 并且Plus版于所有语言之上的平均说话人相似度达到82.75%, 这一数据在行业里面处在排名第一它保证了多语言环境当中的身份一致性。

具备特殊支持能力的模型, 针对二十种中文方言, 以往常常出现的致使方言特色趋于减弱的问题居然被切实破解得干干净净一尘不染, 合成出来的语音愈发贴近以该语言当作母语且长期大量使用的人群的表达习惯, 从粤语这种具体的方言, 到闽南语这种特定范围的方言, 再到除却这二者之外的其他种类的小众方言, 均能够始终如一地维持住独具一格的带有明显地域特征的韵味, 在相当大的程度上极其丰富并拓展以本土当地为核心基础的应用的各种可能性。

自由指令与细粒度控制

用户并不需要去掌握专业性的音频标注技能, 仅仅只需要凭借自然的语言指令, 便能够生成具备特定风格的语音, 比如说, 输入“温柔客服语气”, 或者输入“带货主播风格”, 模型就能够精确地还原相应的情感色彩以及语调节奏, 这么一种Free-style的控制方式, 极大程度地降低了其使用门槛。

与此同时, 此模型亦是具备涵盖细粒度的结构化标签控制能力。用户可精准地进行调控诸如呼吸声、笑声等属于非语言范畴的细节之处。这对于像是游戏角色配音、沉浸式有声书制作等场景而言是极为关键重要的。借助对这些细微的声音元素予以微调, 能够极为显著地实现提升内容的真实感以及感染力的效果。

强鲁棒性保障稳定输出

面临繁杂的声学环境时, Qwen – Audio – 3.0 – TTS展现出了超强的鲁棒性。哪怕参考音频里存有高噪声或者高混响, 模型也能够自行过滤杂音, 留存核心的音色特征这个抗干扰能力保证了合成质量的稳定性 , 让因录音条件不好致使的输出瑕疵避免了。

该特征致使模型于现实运用里更为靠谱, 在嘈杂的线下活动直播之时, 在录音条件受限的远程协作场面当中, 均可给出清晰、纯净的语音输出。开发者无须格外顾虑环境杂音带给最终成效的作用, 进而专心致志去优化上层应用逻辑。

全面开放助力生态构建

阿里通义千问语音合成全球第一,16种语言自然度领先

现阶段, 此模型于阿里云百炼平台已全面放开, 开发者能够随时接入去体验。与之配套的精品种音色库涵盖了指令、方言以及小语种等多样类型, 从而为多样化需求给予支持。预估7月24日会开放48K高清音频输出功能, 进而进一步提高音质上限。

最长单次合成可支持3分钟长文本, 此举满足了长篇幅内容的生成要求, 阿里云期望借由这一技术开放, 同开发者一块儿探寻语音交互的全新可能性, 你是否准备好要怎样借助这项处于全球领先地位的语音技术, 给自己的产品赋予更具生动性的声音了呢?

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。