語言是人類表達情感與文化的核心,但長久以來,數位技術僅服務於少數主流語言,導致數千種活語言與方言在數位世界中被邊緣化。根據 Google 的最新分享,其語言技術已擴展至支援超過 300 種語言,覆蓋全球約 86% 的人口。然而,Google 指出,真正的溝通突破不能僅止於文字的對譯,而必須讓 AI 具備理解真實世界溝通脈絡的能力,讓每個人都能以自己的方式被理解。
從文字翻譯轉向原生音訊理解
傳統的語音辨識系統採取的是一種線性且僵化的多步驟流程:首先將音訊轉錄為文字,接著處理文字內容,最後再將其合成回音訊。這種做法雖然可行,但會剝離溝通中最重要的元素,包括語調、節奏、情感以及上下文脈絡。在現實生活中,人們很少使用完美的文法,而是充滿了笑聲、停頓、重複,甚至在同一句話中切換多種語言,例如 Spanglish(西班牙語與英語混合)或 Hinglish(印地語與英語混合)等現象。
為了捕捉這些細節,Google 改變了技術路徑,不再依賴文字轉錄,而是開發原生音訊智能。透過如 Gemini 等模型,AI 可以直接處理原始音訊,同時掌握聲音特徵與說話者的真實意圖。這項進展體現在 Gemini 3.5 Live Translate 中,它能支援 70 種語言及 2,000 多組語言對的即時口譯,並能自然地處理語碼切換(Code-switching,指在對話中切換不同語言或方言)與情感線索。此外,Gemini 3.5 Transcribe 則能將嘈雜環境或包含專業術語的原始音訊轉化為精確的格式化文字,並透過 Android Gboard 的 Rambler 功能,利用語音指令自動去除贅字並修正文法。
突破數據匱乏:1,000 種語言計畫與社群合作
AI 模型的效能高度依賴數據量,但網路上的資料分佈極不均勻,主流語言佔據絕大多數。為了實現支援全球 1,000 種最常用語言的目標,Google 採用了跨語言遷移學習(Cross-lingual Transfer Learning)。這是一種讓 AI 將從數據豐富的語言中所學到的模式,遷移並應用到數據稀缺語言的技術,從而提升對少數語言的理解力。
除了算法優化,Google 意識到必須走出實驗室,與在地社群合作以獲取真實的語言數據。目前已啟動多項開源數據合作計畫:WAXAL 專案與馬克雷雷大學等機構合作,建立了涵蓋 27 種撒哈拉以南非洲語言的大規模語音數據集,捕捉傳統數據集常遺漏的聲調變化。Project Vaani 則在印度採取以區域而非語言為核心的採集方式,收集了 109 種語言、超過 3 萬小時的語音資料。而 Amplify 計畫則與全球四個大洲的 1,600 多名專家與 20 所大學合作,貢獻了 1.5 萬個包含在地細節的多模態數據點。為了讓這些資源透明化,Google 推出了 Language Explorer 工具,將全球最大的開源語言數據庫 LinguaMeta 視覺化,持續追蹤超過 7,000 種口語、書面與手語。
解決現實限制:離線部署與硬體門檻
技術的普及不僅是語言問題,更是基礎設施問題。全球仍有超過 30 億人無法穩定連接網路,且許多低資源地區的人們仍在使用功能手機(Feature Phones)而非智慧型手機。為了打破這個限制,Google 開發了 TranslateGemma,這是一系列基於 Gemini 構建的輕量級開源翻譯模型。由於 TranslateGemma 可以在裝置端(On-device)高效運行,使用者不再需要依賴雲端連接即可獲得高品質的翻譯服務。
針對無法使用智慧型手機的群體,Google 則與 Viamo 合作推出名為 AVA 的語音 AI 助手。AVA 將 Gemini 的能力整合進傳統的功能手機中,透過互動式語音應答(IVR)系統提供服務。在盧安達的試行中,AVA 已成功回答了超過 200 萬個問題,讓缺乏高端硬體的使用者也能獲取 AI 的幫助。
擴展表達維度:無障礙設計與文化尊重
語言的定義不應僅限於口語或文字。為了照顧非標準語音使用者與聽障人士,Google 開發了手語轉文字(Sign Language-to-Text, SL2T)技術。該系統經過 50 多種手語訓練,目前已在 Pixel 11 的 Gboard 與即時轉錄功能中實現美國手語(ASL)轉英語的聽寫,旨在為全球 7,000 萬名依賴手語溝通的人提供便利。
此外,Google 強調文化脈絡在技術中的重要性。例如在導航應用中,地名的錯誤發音不僅會造成混亂,更可能忽視該地的文化遺產。因此,Google 與紐西蘭的毛利語專家合作,修正 Google Maps 中的地名發音,確保文字轉語音模型能反映真實的在地文化與遺產。
這場語言 AI 的革命顯示,技術不應縮小人類表達的光譜,而應將其擴展。透過將 AI 整合進搜尋、Android、Chrome 與 YouTube 等平台,Google 試圖建立一個能理解上下文、尊重文化並慶祝多樣化溝通方式的系統,讓全球更多人能在自己的語言環境中獲得平等參與的機會。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。