Google正将人工智能驱动的语言技术拓展到文本翻译之外,专注于理解对话中的语气、情感、语境、俚语和文化细微差别。如今,该公司的技术和产品支持300多种语言,为占世界人口86%的7十多亿人的日常交流提供支持。2006年推出的Google Translate也已从支持少数几种语言扩展到250多种语言。
Google表示,传统语音识别系统先将语音转换为文字,再重新转换为语音,在此过程中会丢失交流中的重要元素。该公司正在训练Gemini等模型,使其能够直接处理语音,同时理解含义和说话方式。其目标是让系统能够理解笑声、停顿、多人同时说话,以及Spanglish或Hinglish等语言混合现象。
由于互联网中的主流语言占比失衡,该公司正与当地社区开展开放数据合作,以支持代表性不足的语言。全新的Language Explorer工具通过将全球最大的开源语言数据存储库LinguaMeta可视化,持续绘制7,000多种口语、书面语和手语的分布图。在Google.org支持下的Centre for Digital Language Inclusion以及AI Singapore的Project Aquarium,也在帮助多语言工具惠及农民、医护人员、教师和其他基本服务从业者。
针对无法获得可靠互联网连接的超过3十亿人,Google开发了基于Gemini、使用55种语言训练的轻量级开放翻译模型系列TranslateGemma。该系统可在设备端运行,无需互联网或云端连接。Google还支持Viamo的“Ask Viamo Anything”(AVA)服务,该服务将Gemini支持的语音助手引入功能手机。在卢旺达的试点项目中,AVA回答了超过2百万个问题。
Sign Language-to-Text(SL2T)使用50+种手语训练,可在Pixel 11上通过Gboard和Live Transcribe实现从手语到文本的听写;第一阶段将American Sign Language(ASL)翻译成英语。这项工作旨在提高70百万名手语使用者的无障碍使用体验。在新西兰,Google与毛利语专家合作,改进了Google Maps中地名的发音。Google的语言技术还通过包括Search、Android、Chrome、YouTube和Google Play在内的九个平台,将超过5十亿人连接起来。
为何重要
这一方法的基础是,翻译服务不再局限于生成词语对应译文,还会处理表达方式和文化语境,从而减少交流中丢失的信息。可在设备端运行的轻量级模型,使缺乏可靠互联网连接的人无需再将云端连接作为使用条件;而搭载到普通手机上的语音助手,则降低了对智能手机的依赖。将手语支持直接加入键盘和转写工具,也使无障碍功能不再是一项独立服务,而是成为大众产品的一部分。与本地社区建立的开放数据合作关系,旨在弥补互联网上代表性不足的语言被纳入系统时所面临的数据缺口。不过,首项手语转文本翻译仅提供从ASL到英语的支持,这也使其他手语将在多大程度上获得支持仍是一个悬而未决的问题。