谷歌于9日(当地时间)推出了新的实时语音翻译模型“杰米奈3.5实时翻译”。该模型将逐步应用于谷歌翻译应用、视频会议服务谷歌Meet以及开发者用的杰米奈实时API(实时语音功能集成工具)等。
新模型能够自动识别对话中的语言,无需用户提前选择翻译语言。它可以识别70种以上的语言并将其转换为其他语言的语音,适用于多种语言混合的对话场景。
最大的变化在于翻译速度。传统的语音翻译往往在对方说完后才输出翻译语音,而新模型则可以在对方发言时同步输出翻译语音。谷歌表示,原话与翻译语音之间的时间差仅为几秒。
语音质量也得到了提升。新模型不仅传达句子的意思,还尽量反映原说话者的语调、语气、语速和音高。目标是实现更接近真实对话的翻译语音,而非机械化的朗读。
利用这一功能,用户在旅行中与当地人用不同语言交流时,可以通过手机获得接近实时的语音翻译。
谷歌Meet将首先为部分企业客户提供该功能。谷歌计划在本月内向企业用户的谷歌工作区客户测试新语音翻译功能,并在年内扩大适用范围,旨在实现多语言会议中的实时翻译。
开发者可以通过杰米奈实时API和谷歌AI工作室进行测试。开发者可以利用这一功能创建实时语音翻译服务。实时媒体平台如Agora和LiveKit等也支持相关功能的集成。
打车服务Grab正在测试将该模型应用于司机与乘客之间的多语言通话。通过应用程序实现不同语言的司机与乘客之间的实时翻译通话。
谷歌表示,将在所有生成的语音中应用SinsID水印,以便识别AI生成的语音。SinsID水印是一种在AI生成的语音中嵌入不可见识别标记的技术。
※ 本报道经人工智能(AI)系统翻译与编辑。


