Creation & Building

揭秘数采工厂:稀缺的机器人数据,到底难在哪儿?|机器人特辑

YouTube 05/15/2026

Summary

機器人領域面臨數據荒漠困境——互聯網數據充足的大語言模型能倍增參數涌現能力,但機器人需要的是真實物理世界中具身本體與環境互動產生的多維度傳感器信號,這些數據天然不存在網上。影片揭示機器人數據的四層金字塔結構:頂層遙操真機數據質量最高但成本極高、需人工採集;第二層仿真合成數據規模無限但存在真實鴻溝;第三層動作捕捉數據來自人類示範但有具身差異;底層影片數據量龐大但質量最低。各公司採取混合策略——中國廠商利用人力成本優勢建設數據工廠規模化採集,矽谷公司則押注影片數據和強化學習自動產生訓練數據。開源數據與真實部署形成飛輪效應,但機器人的縮放定律與任務級泛化能力仍待驗證。

Key points

  • 機器人數據不存在網路,必須透過真機採集、仿真或人類示範手動產生,無法像 LLM 般自動取得
  • 四層金字塔結構權衡質量與成本,各層有不同優劣:遙操最精準但貴,影片量大但低質
  • 仿真到現實鴻溝主要在動力學層面,物體接觸、材料形變、液體流動等現象難以精確模擬
  • 中國建廠方案利用人力成本優勢規模化採集,矽谷公司轉向影片和強化學習減少遙操依賴
  • 開源數據驅動生態飛輪,但機器人是否具備縮放定律、能否實現任務級泛化仍是業界關鍵問題

Chapters

  1. [0:00] 開場:機器人的數據危機

    機器人領域面臨數據荒漠,缺乏訓練所需的真實物理互動數據,對比大語言模型能從網路海量文本學習的優勢。

  2. [1:55] 什麼是機器人數據?四層金字塔架構

    機器人需要具身本體產生的多維傳感器信號,包括視覺、力覺、關節位置、電機控制,與互聯網可得的文本、影像、音聲數據本質不同。

  3. [5:29] 第一層:遙操真機數據採集工廠

    透過遙操系統採集機器人真實場景操作數據,品質最高但成本極大。專業採集員需天賦、訓練和體力,8小時工作僅產出2-3小時有效數據。

  4. [11:58] 第二層:仿真合成數據與真實鴻溝

    虛擬環境無限規模生成訓練數據,但動力學層面難以精確模擬真實物理。Sim-to-Real 和 Real-to-Sim 鴻溝是業界核心挑戰。

  5. [16:40] 第三層:動作捕捉數據與具身差異

    從人類示範映射機器人動作,數據品質高但人機結構差異造成具身鴻溝,且無法捕捉觸覺反饋和語義對應。

  6. [19:34] 第四層:網際網路影片數據的潛力

    YouTube 等海量影片提供世界模型和預設用途認知,但缺乏力觸覺資訊。Egocentric 和 Human-Centric 視角的組合最有價值。

  7. [28:14] 區域策略分化:中國廠商 vs. 矽谷公司

    中國利用人力成本優勢建設遙操工廠規模化採集,矽谷公司轉向影片數據、強化學習和真實部署自動產生訓練數據的策略。

  8. [32:59] 開源飛輪與未來問題:縮放定律能否成立

    開源數據帶動生態和硬體銷售,但機器人是否具備 LLM 般的縮放定律、能否實現任務級泛化仍是業界待驗證的根本問題。

Quotes

機器人領域最羨慕人工智慧大語言模型領域的什麼?答案是數據。網路上沒有用於訓練機器人的數據,現有的影片數據遠遠不夠。
0:00
它的難點就在於,這些數據天然是不存在網際網路上的。操作員是感受不到機器人的感受。這就是整個行業數據困境的根源。
3:44
機器人在仿真裡面練得再好,放到真實世界裡面往往會出現問題。因為仿真環境是人用程式碼構建的物理世界的近似,但真實世界的物理要複雜得多。
13:54
遙操數據在整個數據池裡面大約是萬分之一的存在,但就是這萬分之一往往是最終決定模型能否在真實場景裡落地的關鍵。
27:29
面對這個數據荒漠,我們算是種下第一棵樹,希望將來能變成一片森林。英偉達第一代具身基礎模型 GR00T N1 訓練用的真實世界數據裡約 80% 都來自 AgiBot World。
33:34
Explore collisions ↗
Start HereSeriesCore IdeasFeed WallKnowledge GraphCollisionsAboutSearchContact
EN
Font Size