
記者吳立言/綜合報導
Google 宣布推出全新語音模型 Gemini 3.5 Live Translate,可在超過 70 種語言之間提供近即時的語音對語音翻譯服務。新技術不僅能自動辨識語言,還能保留原說話者的語調、語速與音高,讓跨語言交流更加自然流暢。
Google 發表新一代即時翻譯模型
根據 Google 公布資訊,Gemini 3.5 Live Translate 是最新的音訊 AI 模型,能夠在使用者說話過程中同步處理語音內容,而非等到完整句子結束後才開始翻譯。Google 表示,傳統輪流式翻譯系統通常需要等待講者說完一句話才能產生譯文,而 Gemini 3.5 Live Translate 則能持續生成翻譯語音,將延遲控制在數秒內,減少對話停頓與等待時間。
支援超過 70 種語言
新模型可自動偵測超過 70 種語言,無須手動切換語言設定,並可處理多語言混合輸入內容。Gemini 3.5 Live Translate 具備較強的環境噪音容錯能力,即使在嘈雜環境中,也能維持翻譯品質,因此適合應用於跨國會議、課程教學、現場活動、廣播與即時口譯等情境。
Google Meet 也將導入新翻譯技術
Google 同時宣布,Google Meet 的語音翻譯功能未來將採用 Gemini 3.5 Live Translate 技術。相較於過去僅支援少數語言,新版本將擴大至 70 多種語言,並支援超過 2000 種語言組合互譯,不再侷限於以英語作為主要翻譯橋樑。相關功能本月起將先向部分企業版 Google Workspace 客戶開放測試,預計今年稍晚擴大推送。
Google 翻譯 App 同步升級
除了企業應用外,Gemini 3.5 Live Translate 也開始導入 Google 翻譯 App,支援 Android 與 iPhone 平台。使用者只需連接耳機,即可透過 Live Translate 功能體驗近即時語音翻譯。Google 表示,新系統能盡可能保留講者原本的語氣與說話風格,提升跨語言對話的真實感。
針對 Android 裝置,Google 也新增「Listening Mode(聆聽模式)」,使用者可像接電話一樣將手機貼近耳朵,直接透過聽筒收聽翻譯結果,不一定需要耳機即可使用
AI 生成語音加入數位浮水印
Google 也強調,所有由 Gemini 3.5 Live Translate 產生的音訊內容都會嵌入 SynthID 數位浮水印技術。該技術可在不影響音質的情況下標記 AI 生成內容,讓系統後續能辨識音訊是否由 AI 建立,作為防範假訊息與提升內容透明度的一環。
