對於開發實體 AI(Physical AI)的工程師來說,最困難的挑戰之一就是讓機器人不僅能「看到」環境,還能「理解」環境如何隨時間改變」。傳統的視覺模型大多只能做分類或偵測,但要讓機器人在工廠或醫院中自主運作,它需要一種能力:預測如果我採取某個動作,世界會變成什麼樣子。這就是 NVIDIA 推出的 Cosmos 3 Edge 試圖解決的核心問題。
什麼是世界模型 World Model
簡單來說,世界模型是一種能學習環境動態的系統。它不只是識別物體,而是理解物體、運動、空間關係以及動作產生的影響。
舉例來說,當機器人要拿起一個杯子時,僅僅識別出那是杯子是不夠的。它必須理解杯子的精確位置、夾爪移動的軌跡,以及接觸瞬間會發生什麼。世界模型能讓機器人進行推理:它能預測動作後的視覺結果,或者反過來推論要達到某個視覺結果需要採取什麼動作。
Cosmos 3 Edge 的定位與實務影響
Cosmos 3 Edge 是一個擁有 40 億參數(4B)的開放世界模型,其核心目標是在記憶體受限的邊緣設備(Edge Devices)上,提供接近資料中心等級的性能。
對於工程師而言,這意味著你可以將其部署在 NVIDIA Jetson 或 RTX GPU 等設備上,實現即時推理。在實務應用中,它能以 640x360 的解析度處理視覺觀察,並在 Jetson Thor 平台上達到 15Hz 的即時控制頻率,每次推理能生成 32 個動作指令。這讓機器人能夠在毫秒等級的反應時間內,完成從感知到決策的閉環。
技術架構:雙塔設計與共享表示
Cosmos 3 採用了獨特的雙塔 Transformer 架構,讓模型能同時處理理解與生成兩種任務。
第一個是自回歸塔 Autoregressive Tower。它處理視覺和文字 Token,主要負責理解與推理。當你給它一個指令或一張圖片時,它會分析當前狀態並輸出推理結果。
第二個是擴散塔 Diffusion Tower。它處理視覺、音訊和動作 Token,負責預測、生成與神經模擬。它能生成未來可能的視覺畫面或具體的動作序列。
這兩個塔最關鍵的設計在於它們共享多模態注意力層 Multimodal Attention Layers。這層結構將語言、影像、聲音與動作對齊在同一個表示空間中。因此,模型可以在生成輸出之前,先對場景進行邏輯推理,確保生成的動作與物理世界相符。
統一動作表示法 Common Action Representation
在機器人領域,不同設備的動作定義完全不同。例如,無人車關注的是位姿(Pose)與移動,而機械手臂關注的是末端執行器(End Effector)的位置與夾爪狀態。
Cosmos 3 解決這個問題的方法是將這些不同的實體形態映射到一套統一的幾何向量中,涵蓋平移 Translation、旋轉 Rotation 以及操作狀態 Manipulation state。這種做法讓模型能直接將像素的變化與物理運動聯繫起來,使生成的預測影片不再只是視覺上的模擬,而是具有物理意義的動作預演。
從世界模型到策略模式 Policy Mode
當 Cosmos 3 切換到策略模式時,它會將輸入的當前狀態,直接轉換為動作指令以及該動作預期的視覺結果。
這種雙向流動的能力非常強大:模型既可以預測動作產生的效果,也可以根據想要的結果反推應採取什麼動作。為了方便開發者快速上手,NVIDIA 同時釋出了基於 DROID 數據集訓練的 Policy 版本,專門用於抓取與放置(Pick-and-place)任務。
部署與優化路徑
對於想要將此模型應用於特定場景的工程師,Cosmos 3 提供了兩條優化路徑。
首先是後訓練 Post-training。開發者可以使用 H100 或 DGX Station 等設備,利用領域特定數據對 4B 模型進行微調,以提升在特定工業或醫療場景下的準確率。
其次是蒸餾 Distillation。NVIDIA 提供了 Super 4-Step 蒸餾檢查點,將原本需要 35 到 50 步的擴散去噪過程縮減至僅 4 步。這在保持影像品質的前提下,將推理速度提升了約 25 倍,極大降低了邊緣端的運算壓力。
總結
Cosmos 3 Edge 將理解、預測、模擬與行動整合在一個共享的世界表示中。它打破了視覺模型與控制模型之間的隔閡,讓開發者能更輕鬆地構建具有物理常識的 AI Agent。
來源:huggingface.co (Introducing Cosmos 3 Edge)
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。