機器人學習目前面臨的核心挑戰並非模型架構,而是數據短缺。雖然我們已經擁有強大的 Transformer 基礎視覺語言動作模型(VLA)、擴散策略(Diffusion Policy)以及世界模型,但缺乏大規模且多樣化的真實世界操作數據。傳統上,採集這類數據需要昂貴的遙操作設備(Teleoperation rig),這不僅成本高昂,且操作繁瑣,難以快速擴展到各種不同的任務場景。
為了打破這個瓶頸,Pollen Robotics 推出了 Grabette,一套低成本且開源的機器人操作數據採集系統。其核心理念非常簡單:不需要昂貴的機器人,只要用人類的手持操作,就能生成機器人可以學習的數據集。
從手持設備到訓練數據的技術路徑
Grabette 的運作邏輯是將人類的手持動作轉化為機器人可理解的 6-DoF(六自由度,包含三軸位置與三軸旋轉)軌跡。它由一個手持夾爪組成,內建了關鍵的感測器來記錄動作。
為了兼顧視覺感知與定位精度,Grabette 採用了雙攝影機設計。第一台是廉價的廣角魚眼鏡頭,用來模擬機器人腕部相機的視角,提供豐富的環境上下文資訊,這對後續訓練視覺運動策略(Visuomotor Policy)至關重要。第二台則是 RGBD 深度相機(採用 OAK-D),專門負責高精度的 6-DoF 追蹤,確保記錄的空間軌跡準確無誤。
此外,設備內建了 IMU(慣性測量單元)與磁編碼器,用來同步記錄夾爪的開合狀態與運動加速度,所有數據透過 Raspberry Pi 統一時鐘同步記錄,確保時間軸的一致性。
數據處理管線與生態整合
採集到原始數據後,需要將其轉化為可訓練的格式。Grabette 將整個處理流程整合進 Hugging Face 生態系,讓工程師無需安裝複雜的本地環境即可完成處理。
處理流程分為兩個階段。首先是記錄階段,使用者按下按鈕開始執行任務,數據直接儲存在 Raspberry Pi 中。接著進入處理階段,使用者將數據上傳至 Hugging Face Space,系統會調用 RTAB-MAP 函式庫執行 SLAM(即時定位與地圖構建),將相機的影像轉化為空間軌跡,並驗證軌跡是否平滑、有無跳變。
最後,系統會將處理後的數據轉換為 LeRobot 格式。LeRobot 是一個開源的機器人學習框架,讓數據能與不同的學習算法無縫接軌。
從數據採集到實際執行的閉環
為了證明這套系統的實用性,開發團隊設計了 Gripette,它是 Grabette 的機器人端對應設備。Gripette 是一個電動夾爪,具有與 Grabette 相同的硬件基因(相機與感測器配置),安裝在任何工業機器手臂的末端。
實作路徑如下:使用 Grabette 記錄約 200 次的人類操作演示,將數據集上傳至 Hugging Face,使用 LeRobot 訓練一個擴散策略模型(Diffusion Policy),最後將模型部署到安裝有 Gripette 的 7-DoF 機器手臂上。這種設計讓整個流程從數據採集到模型部署形成了一個完整的閉環。
技術重點與實務影響
這套系統最重要的貢獻在於降低了數據採集的門檻。它將原本需要實驗室等級設備的遙操作,簡化成了像拍攝影片一樣簡單的手持記錄。
由於 Grabette 採取機器人不可知(Robot-agnostic)的設計,它記錄的是笛卡爾空間的位姿而非特定關節角度,這意味著同一份數據集可以用於驅動不同品牌或型號的機器手臂,只要末端安裝了匹配的 Gripette 夾爪即可。
這種開源且低成本的方案,旨在建立一個由社群驅動的大規模協作數據集,讓機器人學習不再被昂貴的硬件所限制。
來源:huggingface.co
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。