Google 近期發表了兩款針對語音互動設計的高階模型:Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking。這兩款模型的核心目標在於打破傳統 AI 語音助手「問答式」的僵硬互動,將其轉化為更接近人類直覺的「協作式」對話。透過強化近即時推理(Near Real-time Reasoning)能力,AI 現在能夠在維持流暢對話的同時,在後台處理複雜的邏輯運算與工具調用,讓使用者感覺 AI 正在與自己同步思考,而非單純的指令接收器。
背景與產品定位
在過去的語音 AI 體驗中,使用者經常遇到延遲感或必須等待 AI 完成所有運算後才能聽到回答的窘境。為了克服這一點,Google 推出了兩種定位不同的模型以滿足不同場景的需求。Gemini 3.8 Live 專為大規模應用與成本效率設計,強調對話的流暢度與視覺感知能力(Visual Grounding),適合需要快速反應且資源消耗較低的日常互動。而 Gemini 3.8 Live Extended Thinking 則定位於處理高複雜度任務,強化了多步驟推理能力,讓 AI 能在處理艱深問題時,依然保持對話的連續性而不中斷。
核心技術與運作機制
這兩款模型最顯著的技術進步在於平行處理能力。Gemini 3.8 Live 能夠在近即時地處理視覺輸入,這意味著它能透過攝影機看到的畫面來豐富對話內容。例如,它可以在使用者進行員工入職培訓或下棋時,根據即時畫面提供指導。此外,該模型支持 97 種語言的自動偵測與切換,且能在對話過程中於背景執行 API 調用或工具操作,讓使用者在聊天時,AI 已經在後台完成了請求。
針對更深層的邏輯需求,Gemini 3.8 Live Extended Thinking 引入了同步推理與發聲的機制。當面對複雜工作流時,模型會使用自然語言提示(例如:讓我幫您確認一下...)來告知使用者它正在思考,並在執行多步驟後台任務時提供即時的進度旁白。這種設計將傳統的「黑盒運算」轉化為可感知的協作過程。實務應用中,這使得 AI 能在語音指引下,將粗略的草圖即時轉換為可運作的 React 組件(一種用於構建使用者介面的 JavaScript 函式庫),或在不中斷對話的情況下協調多個異步函數調用來完成複雜的預約流程。
效能表現與實務意義
根據第三方評測,Gemini 3.8 Live Extended Thinking 在語音到語音質量指標(Speech to Speech Quality Index)中表現卓越,並在代理任務完成度(Agentic Task Completion)相關基準測試中領先。這意味著該模型不僅說話像人,更能有效地將語音指令轉化為實際的行動。對於企業而言,這類模型提供了構建生產級語音代理(Voice Agents)的基礎,能將精準度與對話品質平衡在一個高效的區間內。
對於一般使用者,這些能力已整合進 Google Workspace(如 Docs Live, Gmail Live, Keep Live)以及 Search Live 中。使用者可以直接透過語音在文件中進行協作,或在搜尋過程中獲得即時的逐步故障排除指導。對於開發者,Google 透過 Gemini Live API 與多個平台(如 Vercel, LiveKit 等)合作,簡化了即時媒體串流基礎設施的部署,讓開發者能專注於設計使用者體驗而非底層傳輸。
限制與安全性考量
儘管即時語音 AI 帶來了極大的便利,但隨之而來的是深度偽造(Deepfake)與誤導資訊的風險。為了確保透明度,Google 為所有由該系列模型產生的音訊導入了 SynthID 技術。SynthID 是一種不可感知的數位浮水印,直接編織在音訊輸出中,即使人耳無法察覺,但系統仍能偵測出該內容是由 AI 生成。這項安全機制旨在防止 AI 語音被濫用於散布假訊息,確保技術在責任框架內發展。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。