在傳統的機器人開發中,工程師通常需要為每個動作編寫精確的邏輯,或者訓練一個專門的模型來處理特定任務。然而,現實世界的環境充滿變數,機器人最困難的不是「如何移動」,而是「現在該做什麼」以及「我做完了沒」。Google 推出的 Gemini Robotics ER 2 正是為了解決這個問題而設計的 Embodied Reasoning(具身推理)模型。
所謂的 Embodied AI(具身智能),是指 AI 不再僅僅存在於螢幕後的聊天視窗,而是擁有物理身體,能與現實世界互動。Gemini Robotics ER 2 在這裡扮演的角色是機器人的高層大腦(High-level Brain),它不直接控制馬達的電流,而是負責理解指令、規劃步驟並監控進度。
高層推理與底層執行的解耦
要理解 ER 2 的運作方式,首先要區分高層推理與底層執行的差異。在 ER 2 的架構中,它並不直接操作機械手臂的關節,而是將底層的執行交給 VLA 模型(Vision-Language-Action Model,視覺語言動作模型)。VLA 模型的作用是將視覺資訊和指令轉化為具體的物理動作。
ER 2 作為協調者,會將 VLA 模型或導航 API 定義為可調用的工具(Tools)。當使用者下達指令時,ER 2 會思考步驟,然後調用對應的 VLA 工具來執行。這種設計讓開發者可以靈活替換底層的硬件或控制模型,而不需要重新訓練整個大腦。
解決機器人的時間感知與進度追蹤
機器人最容易失敗的環節在於缺乏時間智能(Temporal Intelligence),也就是無法判斷任務的執行狀態。例如,在倒咖啡時,機器人需要精確知道何時停止,否則會溢出。
ER 2 引入了兩種關鍵能力來解決這個問題。第一是連續進度分類(Continuous Progress Classification),它能將影片串流劃分為不同的進度百分比(如 0-20% 到 80-100%)。這讓機器人擁有實時的環境感知能力,如果發現進度卡住或出錯,它可以即時調整動作或重試,而不是死板地執行預設程序。
第二是精準時刻捕捉(Precision Moment-finding),這讓模型能識別出任務完成的確切畫面幀數。ER 2 在這方面的反應速度極快,延遲低於一秒,這對於物理世界的安全性至關重要,因為在現實中,一秒鐘的遲鈍就可能導致碰撞或損壞。
從單機到多機協作的擴展
現實中的任務往往需要不同特性的機器人配合。例如,輪式機器人適合在室內快速移動,而人型機器人則適合處理不平整的地形或操作高處物品。
ER 2 支援多機器人協作(Multi-robot Collaboration),讓不同類型的機器人透過共享的語義理解(Shared Semantic Understanding)進行溝通。這意味著 ER 2 可以將一個複雜的大任務拆解,分配給不同的機器人,並在它們之間建立交接機制,完成單一機器人無法獨立完成的複雜工作流。
安全性與空間推理的提升
對於具身智能而言,安全性高於一切。ER 2 在空間推理(Spatial Reasoning)上做了顯著提升,它不再依賴單張照片快照,而是分析原始影片流來偵測執行過程中的失敗(例如液體灑出或零件滑落)。
在安全性方面,ER 2 強化了對人類近接(Human Proximity)的感知。當模型偵測到人員進入危險區域時,它能自主指令人型機器人立即停止動作,並在環境恢復安全後才重新啟動。這種將安全約束直接整合進推理過程的能力,是 AI 進入人類生活空間的必要前提。
實務影響與開發路徑
對於開發者來說,ER 2 的推出意味著建構物理 AI Agent 的門檻降低。透過 Gemini API 或 Google AI Studio,工程師可以將自己的 VLA 模型或導航接口作為工具掛載給 ER 2,利用其強大的多模態理解能力來處理複雜的任務編排,而無需從零開始構建複雜的狀態機。
來源:blog.google
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。