Intelligence & Order

光模仿人类是没用的!英伟达 AI 揭开机器人公司的演示骗局

YouTube08/10/2026

Summary

拆解卡內基梅隆大學、英偉達與西蒙菲莎大學合作的論文 HRL(混合模仿學習):這是一個統一的底層控制器,讓虛擬人形角色能同時學會像人類一樣精準的動作,又能像跑酷高手一樣即興應對從未見過的隨機地形,甚至只需從 19 段共 30 秒的 YouTube 跑酷影片就能學會複雜運動技能。論文用場景點雲把動作跟蹤與對抗模仿這兩種訓練模式統一到同一個觀測空間,並用消融實驗證明主動在初始化階段製造擾動比僅在測試時加噪音更能帶來魯棒性。內容為簡體中文頻道轉寫,已正體化與用語校正。

Key points

  • 在加了高斯噪音的隨機地形測試中,HRL 拿下技能準確率 0.66、跟蹤誤差 0.31、任務完成率 0.74,優於純任務獎勵(完成率 0.11 且動作變形)與 AMP(會用繞道方式作弊、完成率僅 0.11)等基線
  • 純任務導向的訓練完成率雖可達 0.86,但動作極不自然;HRL 為了保持人類動作優雅寧願犧牲約 12% 的完成率,換取系統動作庫的可複用與穩定
  • 關鍵機制 PSI(擾動狀態初始化):訓練時主動在初始關節角度與速度加入高斯噪音,去除後任務完成率從 0.74 暴跌到 0.52(掉 22%)
  • 若判別器拿掉場景點雲(180 維特徵),任務完成率不降反升到 0.75,但技能準確率從 0.66 崩到 0.38,因為智能體學會用看起來優美但脫離場景的動作騙過判別器
  • 局限性:把賽道從 5 個障礙物拉長到 20 個時完成率降到約 40%;所用的 SMPL 人形模型扭矩遠超真人肌肉極限,難以 1比1 遷移到真實機器人;訓練資料僅 30 秒共 19 段 YouTube 影片,存在物理不自然的殘影
  • 工程啟示:魯棒性的高性價比來源是在訓練初始化階段主動製造麻煩,而非只在評估環境加噪音

Quotes

純做軌跡跟蹤的系統會極其優美,但也會極其脆弱,一旦離開那條算好了的黃金軌跡,它就徹底當機。
0:49
最高性價比的魯棒性,來自於訓練中主動製造麻煩。
20:34
Explore collisions ↗

Quick browse

ProjectsFeed WallSearch

Deep dive

SeriesCore IdeasKnowledge GraphCollisions
AboutContact
繁简EN日
Font Size