Google 近期發布了 Gemini Omni 1.1 Flash 的更新版本,將其定位為一個「生產就緒」的開發者工具。這次更新的核心目標在於解決生成式影片(Generative Video)長期以來面臨的隨機性問題,將 AI 影片的創作過程從單純的「隨機生成」提升到「精準導演」的層次。透過提供更強的控制選項,開發者現在可以將此模型整合進專業的媒體編輯軟體、創意工作流或自動化影片產製工具中。
背景與核心挑戰
在過去的 AI 影片生成中,使用者通常只能透過文字提示詞(Prompt)來描述想要看到的畫面,但很難精確控制鏡頭的移動路徑、場景的連續性以及最終的輸出品質。對於專業製作而言,這種不確定性是巨大的阻礙。Gemini Omni 1.1 Flash 旨在透過引入場景延伸、首尾幀插值以及多層次解析度選項,讓開發者能夠像導演一樣定義影片的起承轉合,而非僅僅依賴機率性的生成結果。
精準控制影片生成的技術能力
場景延伸與敘事連續性
場景延伸(Scene Extension)功能允許使用者在既有影片的末端繼續生成內容。與先前模型僅能參考最後一秒畫面的限制不同,Omni 1.1 能夠分析高達 10 秒的前文脈絡。這項技術大幅提升了視覺一致性(Visual Consistency),確保角色外貌、環境光影在時間軸上不會突然跳變。目前該功能支持以 10 秒為單位遞增,最高可將單一場景延伸至 40 秒,讓 AI 能處理更長且具邏輯性的敘事結構。
首尾幀插值與鏡頭控制
為了實現專業級的鏡頭語言,Omni 1.1 引入了指定首幀(First Frame)與末幀(Last Frame)的功能。模型會根據這兩個關鍵幀,自動計算並生成中間的過渡畫面。這對於需要複雜鏡頭軌跡的場景至關重要,例如 360 度環繞拍攝、快速縮放(Zoom)或無縫循環影片。這種方式消除了傳統 AI 影片中常見的跳剪(Jump Cuts)現象,使鏡頭移動更加平滑且符合物理邏輯。
多模態參考輸入
開發者現在可以在輸入端加入最多三秒的影片參考片段。這意味著 AI 不再僅僅依賴文字描述,而是可以直接學習參考影片中的動作特徵。例如,使用者可以提供一段舞者的動作影片,並要求 AI 將其替換為特定的角色模型,同時保留原有的舞蹈律動。這種多模態(Multimodal)的整合方式,極大地強化了角色一致性與動作的精準度。
開發效率與產出品質的平衡
在實際開發流程中,高解析度影片的生成成本高且耗時。為了加速迭代,Omni 1.1 提供了 360p 的預覽解析度選項。根據 Google 的數據,生成 360p 預覽的速度最高可提升 60%,且成本僅為標準 720p 解析度的三分之一。開發者可以在這個「草稿階段」快速測試多個版本,確認鏡頭路徑與構圖正確後,再將最終成品提升至 1080p 或專業級的 4K 解析度。
實務意義與產業影響
Gemini Omni 1.1 Flash 的推出,讓 AI 影片從「實驗性玩具」轉向「生產力工具」。目前已有如 Adobe Firefly、Figma Weave 以及 Runway 等創意平台將其整合。對於企業而言,這意味著可以建立標準化的影片產製管線,例如自動化生成房產展示影片(精準控制鏡頭在房間間移動)或教育類說明影片(確保細節準確且穩定)。
然而,這類技術仍面臨一定的限制。雖然場景延伸提升至 40 秒,但對於長篇電影等級的連貫性仍有挑戰;且高度依賴高品質的參考幀與精準的提示詞工程。儘管如此,將「控制權」交還給開發者,是讓 AI 影片真正進入專業工作流的關鍵一步。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。