跳到主要内容

谷歌AI新突破支持300多种语言 原生音频智能还原真实交流质感

16 0
AI摘要

谷歌最新发布全球语言智能技术,支持超300种语言,覆盖全球大部分人口。其AI技术不仅实现文本翻译,更深入理解人类真实交流中的语气、情感与文化差异。通过原生音频智能技术,如Gemini3.5Live Translate和Gemini3.5Transcribe,实现跨语言实时口语翻译和高精度语音转文本,并支持低资源语种,推进“1,000种语言计划”。

谷歌公司正式发表了声明, 宣布他们的人工智能语言技术现在已经覆盖了超过三百种不同的语言种类, 并且服务到了世界上百分之八十六这样比例的人口群体。可是依然存在三十亿这样的数量级的人类, 他们没有稳定的网络接入环境。这场关于语言平等的行动最终能够走到多远的那个程度, 确实是值得所有的人都去进行关注的。

从文本翻译到原生音频智能

谷歌原来的语音识别技术是走的那么一个老路子, 就是先把音频转成了文字, 然后再把这些文字又变回音频, 这种多步的处理流程, 就会把那声音里的语调、还有节奏以及情感都给剥掉了, 现在这个是新的架构, 是让模型直接去处理那个最原始的音频数据, 这样就能还原出那些真实对话里才有的那种质感了, 它是不再需要去依赖中间那个文本环节了。

5 Live实现了跨70种语言、以及2000多个语言对的实时口语翻译功能, 它能够自然地捕捉语码转换与情感线索。其使用的高精度语音转文本模型, 可以在嘈杂环境以及专业术语场景中输出规整的文本内容。该模型还赋能安卓键盘, 从而完成语音重写与跨语种切换操作。

谷歌AI新突破支持300多种语言 原生音频智能还原真实交流质感

千种语言计划与跨语言迁移

谷歌正式开启了名为“1000种语言计划”的计划。这个计划的目标, 是要覆盖全球范围内使用情况最广泛的共计一千种语言。该项目的核心支撑, 是一个经过了一千两百万小时音频训练后得出的通用语音模型。

通过跨语言迁移学习这一方法, 他们能够将那些数据资源丰富的高资源语言中所学到的模式, 迁移应用到那些训练数据相对稀缺的语言种类中去。

这套体系的建立, 是建立在过去二十五年的开放研究成果, 以及四百多篇经过同行评审的语音论文基础之上的。它能够为数千种资源较少语种提供切实可行的技术支撑框架。这样一来, 就不需要再依赖大量单一的语料数据了。

在地数据合作替代单一爬取

互联网上的内容天生就特别偏向那些少数几个占主导地位的语种, 所以谷歌就不再是用那一套单一的抓取模式了, 而是转而去跟在地基层那些开源数据搞合作拿东西。

那个叫WAXAL的数据集把撒哈拉以南非洲那边的27种语言都覆盖进去了, “瓦尼计划”是联合了印度科学研究所等等这些机构一起弄的, 用了那种区域锚定的方式去收集, 最后攒出来了超过3万小时的语音数据, 涉及的语言种类有109种之多。

这个叫作“放大计划”的项目汇集了很多本地专家, 这些人总共有一千六百人。他们来自四大洲。还有二十所大学也加入其中。大家一起贡献了许多多模态数据点。还有一个互动式的语言探索工具可以持续工作。它能把这些语言的结构清晰地显示出来。它也能把全球七千多种语言的分布情况可视化地映射展示出来。

无网环境下的轻量翻译方案

全球超过30亿人, 没办法用上稳定的互联网。谷歌推出了轻量级的开源翻译模型家族。这套模型能在55种语言上, 在端侧设备里高效运行。不用连接云端, 也能做高质量的翻译。这就把AI的能力, 送到了没有网络的地方。

在卢旺达, 谷歌是联合了Vianza机构, 在那里做了试点。这个试点是针对功能机的。试点的内容是“询问任何事”语音助手。现在已经借助这个模型, 成功给功能机用户解开了问题。解开的数量是超过200万个。这些场景包含了医疗、农业等方面。这些都是比较高频的场景。

手语与方言发音的无障碍打磨

谷歌推出了一种新的技术。这项技术的名字叫做手语转文本。它基于五十多种手语的训练数据开发而成。它支持美式手语实时转换成英文。它还能够提供实时转录的功能。这让那些发音不太标准的人群, 不需要去迁就现有的工具了。相反, 是这种技术从头开始, 去适配使用者。

谷歌和新西兰的毛利语专家进行了非常深入的合作。他们把地图里地名和街道的正确发音, 放进了文本转语音模型里面。这样做的目的, 是为了保证在每次朗读的时候, 文化语境都能被忠实地还原出来, 而且读音也要完全准确。

二十年积累嵌入九大平台

谷歌用了二十年的功夫来研发, 现在的语言技术已经深深地嵌到了搜索、安卓还有Play这些地方的九个核心平台里面去了。谷歌一边做这些事, 一边还通过数字语言包容这样一个公益项目去做事, 给全球的农民、医护人员和老师不停地提供力量帮助他们。

谷歌强调了这么一件事, 那就是技术的核心意义, 它绝对不是什么要去削减那种表达的多样性, 它的真正目的是去把那个表达的边界给它拓展开。

这是在尊重地方的文化, 也是在尊重那种真实的语境的前提之下。目的是为了帮助更多的这些人, 能够以一种他们自己所习惯的方式去参与进来, 进行表达, 而且也能让这个世界更多的人去理解他们。

你平时在做日常交流的时候, 最经常使用的是哪一种语言? 你觉得人工智能到底能不能非常准确地捕捉到你说话时候那种细微的情感变化以及语气的高低快慢呢? 现在大家可以在评论区里面好好聊聊这个话题的感受, 如果觉得这个内容确实是有用的话, 就一定要记得点赞分享给那些可能需要了解这方面知识的朋友。

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。