在AI语音技术领域,“实时翻译”与“可用”之间,横亘着一道传统流水线架构难以逾越的鸿沟。Google AI此次推出的Gemini 3.5 Live Translate,正是尝试填平这道鸿沟的关键一跃。
不同于常规的级联式方案(语音识别→文本翻译→语音合成),Gemini 3.5直接处理原始音频流。这意味着系统能够保留说话者的语调、节奏和音高,而非生成机械感十足的合成语音。在实践中,这种能力直接决定了跨境通话中“语气”与“情感”能否被准确传递——这是商务沟通和日常对话中不容忽视的细节。
目前Gemini 3.5 Live Translate已支持超过70种语言的语音到语音翻译。东南亚超级应用Grab正将其用于司机与乘客间的跨语言沟通。Grab用户每月发起超1000万次语音通话,其中大量涉及不同语言背景的交流。如果实时翻译能有效运作,意味着司乘双方可以互调母语,而翻译模型则充当“语音代理”实时转译并发音,这在过去几乎不可想象。
对开发者而言,Google不仅开放了模型本身,还提供集成的Gemini Live API,支持开发者通过LiveKit、Fishjam、Pipecat或Vision Agents等工具构建应用。实际案例已初具规模:LiveKit实现了虚拟会议室中的多语言即时理解,不同语言参与者可各自用母语发言,实时翻译后呈现;Software Mansion通过结合MoQ协议,解决了流媒体传输的关键瓶颈;VisionAgents AI则展示了跨会话的动态语言切换——用户在对话中随时切换语言,系统不再需要重新建立语义上下文。
从技术演进角度看,Gemini 3.5 Live Translate的核心突破在于“端到端处理原始音频”与“低延迟”的结合。传统方案中,语音识别和合成各需一次模型推理,延迟叠加明显,且无法保留原始语音的韵律特征。直接处理音频流不仅降低了延迟,还避免了信息在文本化过程中的损失——音调的高低、停顿的长短、语速的快慢,这些非语言信息在商务谈判或客服场景中往往决定对话走向。
对于出海应用和全球化产品,这一能力意味着产品本地化的门槛正在降低。过去需要自行处理复杂的语音翻译链路,如今可通过API快速集成,且效果已接近生产级可用。开发者可前往Google AI Studio直接试用并获取Cookbook示例代码,这进一步降低了实验成本。
值得关注的是,虽然目前Gemini 3.5 Live Translate的延迟已接近近实时,但在多轮对话、复杂口音或背景噪声环境下,其表现仍需更多实测数据验证。结合去年以来Google在音频领域的一系列进展,语音翻译正在从“能听懂”走向“能理解”,而从“理解”到“可用”,这道坎正在被快速迈过。