| 谷歌发布多语言AI新战略,宣布其AI技术与产品已支持超过300种语言,覆盖全球71亿人口及86%的人口比例。技术架构上,谷歌推动原生音频智能,Gemini 3.5 Live Translate实现跨70种语言、2000多个语言对的实时口语翻译,并捕捉语码转换和情感线索;Gemini 3.5 Transcribe作为高精度语音转文本模型,可在嘈杂环境或复杂术语下输出规整文本,并赋能安卓键盘Gboard的Rambler功能。谷歌推进“1,000种语言计划”,依托1200万小时音频训练的通用语音模型(USM)利用跨语言迁移学习技术。语言数据采集方面,谷歌与多个机构合作打造覆盖27种撒哈拉以南非洲语言的WAXAL开源语音数据集;与印度科学研究所及Bhashini合作开展“瓦尼计划”,收集109种语言超3万小时语音;以及“放大计划”汇聚全球1600多名本地专家与20所大学贡献多模态数据点。谷歌推出互动式语言探索工具Language Explorer,用于可视化映射全球超过7000种语言的LinguaMeta数据仓库。谷歌打造TranslateGemma轻量级开源翻译模型家族,针对55种语言在端侧设备上运行,无需云端连接。谷歌通过支持Viamo等机构在卢旺达试点推出“询问Viamo任何事”(AVA)语音人工智能助手,已为功能机用户解答超过200万个问题。谷歌推出基于50多种手语训练、支持美式手语转英文的“手语转文本”(SL2T)技术,赋能Gboard与Pixel11的实时转录。谷歌与新西兰毛利语专家合作,优化地图中地名与街道的本地化发音。谷歌的语言技术已嵌入搜索、安卓、Chrome、YouTube和谷歌Play等九大核心平台。 |
AI INSIGHT
谷歌发布多语言 AI 新战略,让全球每种语言都能被听见与理解
AI 摘要
谷歌发布多语言AI新战略,宣布其AI技术与产品已支持超过300种语言,覆盖全球71亿人口及86%的人口比例。技术架构上,谷歌推动原生音频智能,Gemini 3.5 Live Translate实现跨70种语言、2000多个语言对的实时口语翻译,并捕捉语码转换和情感线索;Gemini 3.5 Transcribe作为高精度语音转文本模型,可在嘈杂环境或复杂术语下输出规整文本,并赋能安