對於許多工程師或內容創作者來說,影片製作一直是一項高門檻的工作。傳統的剪輯流程需要處理時間軸、調整光影、甚至得在攝影機前反覆錄製,這不僅耗時,且對硬體設備有一定要求。Google 近期在 Google Vids 中導入了 Gemini Omni 與個人數位分身(Personal Avatars)兩項核心功能,試圖將影片創作的邏輯從 調整參數 轉變為 對話式指令。
理解 Gemini Omni 的生成與編輯邏輯
Gemini Omni 在這裡扮演的是一個多模態生成模型。所謂多模態(Multimodal),是指 AI 能同時處理文字、圖片、影片等多種不同形式的輸入資訊。在實務應用上,使用者不再需要精通剪輯軟體,而是透過自然語言提示詞(Prompt)來定義影片內容。
這項功能的關鍵在於它支援 參考圖 結合 文字指令。例如,如果你有一張粗略的草圖或一張風格參考圖,你可以將其上傳並告訴 AI 想要達到的效果,模型會將視覺參考與文字描述融合,生成符合預期的片段。
更重要的是,Gemini Omni 解決了 AI 影片生成中最頭痛的 迭代修改 問題。過去的 AI 生成通常是 一次性產出,如果不滿意,只能重新輸入指令並祈禱結果更好。現在 Vids 支援 逐步編輯(Step-by-step edits,你可以像對話一樣告訴 AI 替換背景、修正光影或增加特效,而不需要從零開始重新生成,這極大地提升了創作的精準度。
數位分身如何降低錄製成本
另一項突破是個人數位分身(Personal Avatars)。這是一種數位化的人像合成技術,旨在解決 錄製門檻 高的問題。
在傳統流程中,若要製作一段有講者的影片,你需要準備燈光、相機,且講者必須處於最佳狀態。而數位分身的運作方式是:使用者上傳一張自拍照片(定義視覺特徵)以及一段短小的聲音錄音(定義音色特徵),AI 隨後會建立一個數位模型。之後,你只需要輸入文字腳本,數位分身就會以你的外貌與聲音將內容表達出來。
這對於需要頻繁更新產品演示、內部公告或個人化訊息的企業環境非常有用,將錄製時間從小時級縮短至秒級。
AI 內容的透明度與安全機制
隨著生成式 AI 產出的內容越來越逼真,深度偽造(Deepfake)成為嚴重的安全隱憂。為了應對這個問題,Google 在所有由 AI 生成的片段中嵌入了 SynthID。
SynthID 是一種不可見的數位浮水印(Digital Watermark)。它不是像傳統浮水印那樣直接印在畫面上的圖標,而是將識別資訊嵌入在像素或訊號層級中。即便影片經過截圖或輕微修改,依然可以透過檢測工具驗證該內容是否由 AI 生成。這在工程實務上確保了內容的透明度,避免 AI 生成內容被誤認為真實拍攝的影像。
總結與適用對象
目前這些功能主要開放給 Google AI Pro、Ultra 訂閱者以及 Google Workspace 企業客戶。對於開發者或企業內部溝通者而言,這意味著影片將從 一種昂貴的資產 變成一種 低成本的溝通媒介。
來源:blog.google
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。