在數位內容創作的領域中,影片編輯一直以來都被視為一項高門檻的技術工作。創作者通常需要面對複雜的剪輯軟體、精確的時間軸控制,以及在拍攝階段就必須決定好的分鏡與光影。然而,Google 近期推出的 Gemini Omni 模型,試圖將這種專業且繁瑣的流程簡化為如同日常對話般的互動體驗。Gemini Omni 是 Google 新一代 Omni 系列模型中的核心,其最顯著的突破在於將多模態理解與生成能力深度整合,讓使用者能透過文字、圖像、音訊或既有影片作為參考,直接生成或修改高品質的影像內容。
Gemini Omni 的核心競爭力在於它對物理世界的直觀理解與 Gemini 龐大現實知識庫的結合。傳統的 AI 影片生成往往會出現物體形變或動作不自然的情況,而 Omni 則透過強化對物理邏輯的掌握,確保產出的影片在視覺上更加流暢且符合現實邏輯。這意味著它不僅僅是在像素層面進行預測,而是能理解場景中物體之間的空間關係與動態規律,從而讓生成的內容看起來更為真實。
在實際的應用場景中,Gemini Omni 展現了極強的空間操控與視角轉換能力。透過該模型,創作者可以在不破壞原始場景連貫性的前提下,隨意更改攝影機的角度、切換環境或執行電影級的縮放效果。例如開發者 Leon Lin 的實作證明,僅需簡單指令,就能將同一名女性在城市中的身影從 20 個不同視角呈現,涵蓋了遠景、特寫、俯拍與側拍,且背景中的行人與車輛能保持自然地共存。這種能力打破了傳統拍攝必須實地佈光的限制,讓後製階段具備了重新定義分鏡的可能性。
除了視角調整,Gemini Omni 賦予了創作者改變現實物理環境的能力。透過語音指令,使用者可以直接修改影片中的環境參數,例如將白晝轉為黑夜、將晴天變為雨天,或是將綠葉轉為秋天的橙色並覆蓋積雪。這種對環境光影與材質的動態修改,且能同時同步對應的音效(如雨聲),顯示出模型在處理跨模態一致性上的進步。此外,透過 Google Flow 工具,Omni 還能將簡單的草圖或塗鴉轉化為現實動畫。開發者 Pan 的案例展示了如何將一顆檸檬變成潛水艇,或將咖啡杯轉化為熱氣球,這種將手繪導向與 AI 生成結合的模式,極大降低了動畫分鏡的製作成本。
在視覺風格的遷移方面,Gemini Omni 支援將既有影片在保持動作連續性的情況下,切換至完全不同的美學風格。例如開發者 Jerrod Lew 實作的案例中,一名女性走在街上的原片,能在真人實拍、日系動畫與黏土動畫等風格間流暢切換,而人物前進的步伐完全沒有中斷。這證明了模型能夠在提取動作特徵的同時,將其精準地映射到不同的視覺風格層之上。
對於企業與專業設計端,Gemini Omni 的實務意義在於將抽象概念快速視覺化。Hyperagent 團隊的應用案例顯示,該模型可用於將景觀設計提案直接疊加在空曠公園的影片中,形成對比明顯的前後對照圖;或是將枯燥的數據儀表板轉化為由動畫教授講解的教學影片,甚至將待辦清單遊戲化。這類應用將 AI 從單純的內容生成工具,提升為一種高效的溝通與原型設計介面。
儘管 Gemini Omni 展現了強大的創造力,但其運作仍基於生成式 AI 的概率模型。雖然對物理世界的理解有所提升,但在極端複雜的物理交互或超長時長的影像一致性上,可能仍面臨挑戰。目前該能力已透過 Gemini App、Google Flow、Google AI Studio 以及 Gemini API 等多個渠道開放給開發者與企業使用者,旨在將影片創作的門檻從技術操作轉移到創意構思上。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。