焦點報導 · ARTICLE

Google上線Gemini 3.5即時口譯覆蓋70+語言

Gemini 3.5 Live Translate提供近乎即時、自然的語音翻譯能力。已在 Google AI Studio、Translate、Meet 上線。

講師團隊整理 AI Academy · 編輯部
2026/07/12 發佈 22 觀看 zh-TW
Google上線Gemini 3.5即時口譯覆蓋70+語言 AI 生成示意圖

Gemini 3.5 Live Translate將即時語音互譯帶到70多種語言,重點是「自然、連續、低延遲」。Google表示此模型能保留說話者語氣與節奏,並在僅落後數秒的同步下連續產生譯音,已在API、Meet與手機翻譯陸續上線,利於跨語溝通情境。

這套模型的推出路徑明確,開發者、企業與一般用戶各有入口。Google稱其已在開發者公測、Google Meet企業私測、以及Android與iOS的Google翻譯中啟用,房仲可依自身工具鏈選擇接入,縮短外語客戶溝通的反覆確認時間。

這項即時口譯如何改善跨語客戶溝通?

核心提升是連續、自然且抗噪的即時口譯,讓跨語對話不中斷。Gemini 3.5 Live Translate是Google最新音訊模型,可自動偵測70多種語言,並在翻譯時保留語者的語調、節奏與音高。它一邊聆聽一邊輸出,兼顧等待更多語境與保持同步的取捨,將不自然的停頓降到最低,適合帶看、講解、通話與廣播等場景。

模型的多語輸入與抗噪能力,降低複雜環境下的設定與干擾。Google指出,使用者無須手動配置語言即可多語交談;在嘈雜且突發的環境,系統仍能維持辨識穩定,利於現場看屋、街邊溝通或車內通話時的即時口譯需求。

我現在在哪些產品與階段能用到?

三種入口對應不同使用者:開發者、企業與一般民眾。Google稱,開發者可透過Gemini Live API與Google AI Studio公測使用;企業將於本月起在Google Meet私測;一般用戶可在Android與iOS版Google翻譯啟用即時口譯功能。

生態整合讓語音翻譯App開發更快上線。Google列舉Agora、Fishjam、LiveKit、Pipecat與Vision Agents等平台已整合Gemini Live API,協助處理即時串流媒體的複雜基礎建設,讓開發者專注於體驗設計。Grab亦測試用於司機與乘客接送時的近即時跨語通話。

這對線上會議與遠距簽約流程有何變化?

Google Meet的語音翻譯將擴大語言與配對組合並改善介面。Google表示,Meet將改用Gemini 3.5 Live Translate,語言支援由原本僅五種擴至70多種,並可在單一會議中跨越2,000多種語言組合互譯,且介面將提供更即時的翻譯存取。

企業用戶的導入節奏先私測、再擴大發布。Google稱,本月起先對特定商用Google Workspace客戶進行私測,之後於今年稍晚擴大推出。對跨國團隊談案、遠距解說或簽約流程,語言障礙與等待翻譯的時間可望同步下降。

項目之前(Google說明)以Gemini 3.5 Live Translate後
支援語言僅五種70多種
語言組合僅英語「互譯」會議中可跨越2,000多種組合
介面未及時提供提供即時存取翻譯

行動帶看時,手機翻譯App能做些什麼?

Google翻譯App已導入此模型,耳機可獲更自然的口譯體驗。Google指出,Android與iOS的Google翻譯在使用「即時翻譯」功能時,連接任意耳機即可獲得更順暢、並保留說話者語氣的翻譯,覆蓋70多種語言,利於戶外解說與私密聆聽。

Android新增「聆聽模式」,不戴耳機也能私密收聽譯音。Google稱,使用者可像接電話般將手機貼耳,譯音將直接由聽筒播放;此體驗適合在不便外放的場合快速聽譯,例如旅遊導覽以西語講解、即時聽取英語翻譯的情境。

這些AI語音譯音會如何標示與溯源?

所有AI產生的音訊都會嵌入不可見浮水印以利識別。Google表示,模型輸出的音訊皆以SynthID做浮水印標記,且此標記直接編織在音訊中,協助偵測AI內容、防範錯誤資訊;另提供模型卡說明其安全與責任原則。


資料來源:Google DeepMind — 原文連結

原始來源: https://deepmind.google/blog/fluid-natural-voice-translation-with-gemini-35-live-translate/