【洗碗影片=機器人訓練資料】Figure 砸 10 億美元蒐集真實數據,瞄準家用機器人市場
人形機器人公司 Figure 近期推出「零工經濟平台」Index,個人或企業可以僱用佩戴攝影機的人類工作者,或者親身戴上攝影機,記錄自己在家中、工作場所執行家事任務,比方說洗碗、擦桌子、折棉被等動作的過程,藉此為 Figure 提供大量影像資料,進一步投入機器人訓練,讓人形機器人有朝一日完全接手這些雜務工作。
Figure 執行長 Brett Adcock 表示,公司至今已經為拍攝家務工作過程,向 Figure 提供訓練影像的人類「創作者」支付高達 1,500 萬美元。目前 Index 平台每秒可處理 30 分鐘的上傳影片,且每 1,000 小時可以從中擷取 373 項不同任務、1146 樣獨特物體,以及蒐集 116 種環境相關數據。
自四個月前 Index 平台低調上線後,App 方面已經累積 264,000 次下載,每週活躍使用者數量達 44,000 人,同時有來自 108 個國家的人類創作者,合計向 Figure 資料中心上傳超過 1,600 萬支訓練影片。
除了已經支付給創作者的薪水外,Figure 也預計未來 12 個月內,在資料蒐集和訓練運算方面的合計支出將達 10 億美元,顯見該公司發展人形機器人市場的雄心壯志。
押注數量、多樣性,只有影片夠用嗎?
外媒分析,Figure 這筆 10 億美元的投資,主要涉及三大方向。
首先,該公司認為機器人訓練資料的「數量」與「多樣性」,將是技術發展的重要關鍵;只要記錄下足夠多不同的人、在足夠多不同環境中、進行足夠多不一樣實體活動,並累積成大量影像資料,自然就能獲得更大的訓練優勢。
然而,掌握「數量」與「多樣性」就具備訓練優勢的觀點,雖然聽起來符合邏輯,但是當前的機器人技術領域,卻不像大型語言模型一樣,擁有足夠明確的規模法則,所以 Figure 的想法仍有待觀察。
其次,Figure 認為只要掌握「純視覺影像資料」,對於人形機器人訓練來說就已經足夠。事實上,單純透過相機鏡頭或手機,錄下一般人摺疊襯衫、擦拭桌子的影片,並無法給予機器人關節角度、夾爪狀態、施力、扭力等,更為詳細的動作資料,所以這些細節只能透過後續的推算、預測來獲得。
即便 Figure 日前公開的 Project Go-Big 專案,確實展示出了一套方法,讓透過第一人稱視角拍攝的影片,有辦法轉化為資料並應用到機器人身上,但該專案於規模化應用後,是否還能保持精確仍屬未知。
NVIDIA 領頭,合成資料更快、更便宜
再者,Figure 強調「合成資料」無法解決人形機器人的訓練問題,其數據必須來源自真實世界,相當於對地球上各種環境的物理現象進行「抽樣」;畢竟,現實生活中的物理現象,終究會比任何模擬器所能想到的還要「奇特」,同時捕捉這些現象的唯一方法,依然得是由人類親身實地進行並蒐集資料。
跟 Figure 抱持相反觀點的企業,即是 NVIDIA。近來 NVIDIA 將實體 AI 的技術突破大力押注於合成資料,認為可以利用一小部分真實世界資料集,經放大、延伸後,應用到旗下超過 5,000 個機器人模型與實體機器人訓練上。
以 NVIDIA 的開放式人形機器人基礎模型 GR00T N1 為例,研究人員在套用該模型的 Fourier GR-1 機器人上,蒐集了 88 小時以內部遠端操作為基礎的影像資料。
緊接著,NVIDIA 利用初步資料對影片生成模型進行微調,並產生 827 小時的影像資料,將原始資料量擴增近 10 倍,以生成 780,000 條模擬軌跡,換算下來即是將原本僅 88 小時的影像資料,直接放大到 6,500 小時。
簡單來說,在 GR00T N1 模型的語料庫中,其實只有大約 1% 的訓練資料源於現實世界,其餘 99% 都是由 GPU 所生成的「合成資料」,這種方法對比從真實世界取得資料,例如 Figure 打算斥資十億美元,購買由真實人類進行的工作數據,確實更快、更便宜。
若能穩定發展,訓練集未來規模驚人
Figure 打造 Index 平台的野心令人印象深刻。外媒認為,如果這種趨勢能夠持續下去,Index 所擁有的資料量,將會在短短一周之內,超越所有公開的第一視角影像訓練資料集。
舉凡 Meta 旗下 Ego4D 的 3670 小時、Ego-Exo4D 的 1286 小時、EgoDex 的 829 小時,以及機器人領域公司 Open X-Embodiment 所蒐集的超過 100 萬條軌跡、AgiBot World Colosseo 約 2,976 小時數據,還有 Generalist AI GEN-0 資料庫超過 270,000 小時的真實靈巧操作數據等。
只不過 Figure 對外公布的數據僅為,概念上僅為「資料接收率(Ingest rate)」,而非「最終資料庫規模(Corpus size)」,加上該公司設計的 5 階段處理流程,亦會篩選掉大量訓練數據,所以創作者上傳的一小時影片內容,其實並不等於一小時可用的機器人訓練資料。
普遍而言,附有動作標記的 10,000 小時遙控機器人資料,其價值可能比 100 萬小時隨機內容影片來得更高,但前者每小時蒐集成本介於 50 到 200 美元之間,而後者的拍攝成本則僅需 2 到 5 美元。
側重家庭環境,瞄準家用機器人市場
除了力求技術突破,Figure 選擇大力投入真實世界資料蒐集,亦是為了瞄準消費市場的家用機器人產品而來。
Figure 實際花錢邀請創作者拍攝的內容,如整理床鋪、摺疊衣物、烹飪、打掃、澆花、搬運雜貨、倒垃圾等,重心明顯側重於家庭領域。
由於每間住宅的環境幾乎都截然不同,因此如何讓人形機器人適應家庭,正是此類產品未來最具挑戰性的地方。
對於有意推廣實體機器人的公司來說,訓練資料集就像一張路線圖,所以自然會針對未來即將推出的產品蒐集資料;Figure 是否仍持續朝自己所設想的方向前進,值得後續密切觀察。
從實驗室到產線,機器人正重新定義產業的樣貌。如果你也想站在第一線追蹤這場變革、寫出有觀點與洞察力的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ NVIDIA 預估實體 AI 業務十年內成長 10 倍,分析師點出中國已成關鍵買家
◆ Hugging Face 推 399 美元雙足機器人 Microduck,主打開源、可教學與自主反應
◆ 單次示範就讓機器人學會新任務?Skild AI 推 S1 挑戰數百小時訓練舊模式
*本文開放合作夥伴轉載,參考資料:Forbes、Figure,首圖來源:Figure
(責任編輯:鄒家彥)