在處理長影片分析時,開發者長期面臨一個兩難的選擇:若要提高分析精度,就必須增加每秒抽樣的幀數,但這會導致 Token 消耗量激增,大幅提升運算成本;若為了節省成本而降低抽樣率,則容易錯過影片中轉瞬即逝的關鍵細節。Google 最近針對 Gemini 3.7 Flash、3.6 Flash 以及 3.5 Flash-Lite 推出了一項名為代理式影片理解(Agentic Video Understanding)的新功能,旨在打破這種權衡,讓模型能以更聰明的方式處理影像資訊。
背景與傳統處理方式的限制
在傳統的靜態處理模式下,模型分析影片的方式是採取固定幀率(FPS, Frames Per Second)的抽樣。例如,預設每秒僅擷取一張圖片,將其作為一系列靜態圖像輸入模型。這種方式對於概括影片大意或許足夠,但在面對複雜需求時存在明顯缺陷。首先,如果關鍵動作發生在兩幀之間,模型將完全無法察覺;其次,對於長達數小時的影片,即便低幀率抽樣也會產生海量的 Token,導致成本高昂且推理速度變慢。
核心技術:從被動接收轉為主動掃描
代理式影片理解的核心在於將模型的推理能力與原生的影片工具結合,將分析過程從被動的接收轉變為目標導向的主動搜尋。這就像是將模型從一個只能看著幻燈片的人,變成一個可以自由快進、倒帶、甚至在可疑片段調高解析度重新觀看的操作員。
具體運作方式是透過一個代理迴圈(Agentic Loop)。當模型接收到指令後,它不再一次性讀入所有影像,而是主動決定需要觀看哪些片段、以什麼速度觀看,以及應該使用哪種模態(影像幀、音訊或逐字稿)。如果模型在初步掃描中發現某個時間段具有重要資訊,它會調用內部工具,針對該特定區間進行高幀率的重新採樣與精細檢查。這種動態調整機制讓模型能僅獲取真正必要的訊號,而非盲目地處理整段影片。
實務應用與能力提升
這種主動分析的能力為影片處理帶來了數個突破性的應用場景。首先是次秒級的時刻檢索(Sub-second moment retrieval),模型現在能精準定位毫秒等級的狀態改變或剪接邊界,這對於自動化影片剪輯至關重要。其次是在長影片中進行大海撈針式的搜尋(Needle-in-a-haystack search),即使是數小時的錄影,模型也能在不消耗數百萬 Token 的情況下,準確回答複雜的特定問題。
此外,在異常檢測(Anomaly detection)方面,模型可以針對可疑的時間窗提高採樣率,捕捉快速運動或微小的視覺瑕疵。而在物件或動作計數(Counting action & object)上,由於能動態調整觀看速度,模型能更準確地追蹤重複的物理動作或區分不同物件的出現次數。
效能影響與實務限制
根據 Google 公布的基準測試,代理式影片理解帶來了顯著的效率提升。在 Gemini 3.7 Flash 上,Token 消耗量最高可降低 88%,分析成本最高減少 66%,而分析準確率反而提升了 7%。這種效能增益在長影片(如 10 分鐘的教學影片到 90 分鐘的講座)中尤為明顯。
從成本與品質的帕累托前沿(Pareto Frontier,指在不損害一方的情況下無法提升另一方的最佳平衡點)來看,Gemini 3.7 Flash 結合代理式理解後,達成了目前測試模型中最佳的品質與成本比。
目前該功能已透過 Google AI Studio 和 Gemini Enterprise Agent Platform 的 API 開放使用,開發者僅需將 API 配置中的處理模式設定為 agentic 即可啟用,且無需支付額外功能費用。未來,這項技術也將整合至 Gemini 應用程式以及 YouTube 的 Ask YouTube 功能中,讓使用者能直接在觀看頁面獲得基於視覺內容的高品質解答。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。