코인정보

谷歌推出实时翻译AI模型,支持70种语言

기자 2026-06-10 13:21
AI自动识别对话语言进行语音翻译 反映语调和语气,延迟时间仅几秒 翻译应用率先应用,谷歌Meet为企业客户提供测试
来源:谷歌联合新闻
[来源:谷歌联合新闻]
谷歌近日发布了一款支持70种以上语言的实时翻译人工智能(AI)模型。该模型旨在减少传统翻译方式中等待对方说完后再进行翻译的延迟时间,同时保留说话者的语调和语气。
 
谷歌于9日(当地时间)推出了新的实时语音翻译模型“杰米奈3.5实时翻译”。该模型将逐步应用于谷歌翻译应用、视频会议服务谷歌Meet以及开发者用的杰米奈实时API(实时语音功能集成工具)等。
 
新模型能够自动识别对话中的语言,无需用户提前选择翻译语言。它可以识别70种以上的语言并将其转换为其他语言的语音,适用于多种语言混合的对话场景。
 
最大的变化在于翻译速度。传统的语音翻译往往在对方说完后才输出翻译语音,而新模型则可以在对方发言时同步输出翻译语音。谷歌表示,原话与翻译语音之间的时间差仅为几秒。
 
语音质量也得到了提升。新模型不仅传达句子的意思,还尽量反映原说话者的语调、语气、语速和音高。目标是实现更接近真实对话的翻译语音,而非机械化的朗读。
 
该模型将同时应用于安卓和iOS的谷歌翻译应用。用户可以通过连接耳机来收听实时语音翻译。在安卓设备上,用户还可以通过“听模式”将手机贴近耳朵,像打电话一样收听翻译语音。
 
利用这一功能,用户在旅行中与当地人用不同语言交流时,可以通过手机获得接近实时的语音翻译。
 
谷歌Meet将首先为部分企业客户提供该功能。谷歌计划在本月内向企业用户的谷歌工作区客户测试新语音翻译功能,并在年内扩大适用范围,旨在实现多语言会议中的实时翻译。
 
开发者可以通过杰米奈实时API和谷歌AI工作室进行测试。开发者可以利用这一功能创建实时语音翻译服务。实时媒体平台如Agora和LiveKit等也支持相关功能的集成。
 
打车服务Grab正在测试将该模型应用于司机与乘客之间的多语言通话。通过应用程序实现不同语言的司机与乘客之间的实时翻译通话。
 
谷歌表示,将在所有生成的语音中应用SinsID水印,以便识别AI生成的语音。SinsID水印是一种在AI生成的语音中嵌入不可见识别标记的技术。



※ 本报道经人工智能(AI)系统翻译与编辑。

《 亚洲日报 》 所有作品受版权保护,未经授权,禁止转载。