智能与秩序

微软&哥大重磅开源Orchard,4B小模型凭什么秒杀2350亿大神?AI智能体“工作台”的革命!

YouTube2026/07/19

摘要

解讀哥倫比亞大學、UIUC 與微軟研究團隊發布的 Orchard 研究,指出讓 AI agent 變聰明的關鍵瓶頸其實不在模型大腦,而在執行環境層的破碎與昂貴。Orchard 透過層解耦把環境層從執行框架與訓練器中剝離,利用 Kubernetes 的 Init Container 機制在沙箱啟動瞬間空投輕量工具箱,並將高頻操作走私密的熱路徑直接通道,使指令延遲壓到 0.28 秒,比主流雲端托管平台快 7.3 倍、成本降低約九成。實驗顯示僅 40 億參數的小模型在 Orchard 環境中訓練後,於網頁操作任務上反超 2350 億參數的大模型,證明環境正在成為 AI 下一階段進化的真正槓桿。

重点

  • Orchard 指出業界過去把 90% 甚至 99% 預算砸在讓模型更聰明,卻把每天要用的執行環境當成隨便拼湊的東西,導致 agent 一換框架,之前累積的經驗與資料就全部作廢
  • 過去兩條死路:重度整合的全棧方案讓環境層、執行框架、訓練器焊死在一起,累積的數據無法跨框架遷移;全面托管平台方便但計費高昂,且對沙箱的底層定制與高並發能力受限
  • Orchard 用層解耦把環境層剝離成獨立、可自行托管的輕量基礎設施,並利用 Kubernetes 的 Init Container 機制在沙箱啟動瞬間空投工具箱,不需事先改造任何舊有任務鏡像
  • 透過冷路徑(僅用於初次創建沙箱的複雜官方流程)與熱路徑(後續高頻操作走直連的私密通道)物理隔離,Orchard 平均執行指令延遲僅 0.28 秒,遠優於 E2B 的 0.74 秒與 Modal 的 2.04 秒,快了 7.3 倍
  • 128 個並發沙箱運行 240 小時,傳統托管方案約需 7000 美元,Orchard 因可直接採購雲端閒置的競價實例,成本僅約 673 美元,降低約九成
  • Orchard Suite 用僅 30 億活躍參數的 Qwen3-30B-A3B 混合專家模型,在 10.7 萬條訓練軌跡(含 3.25 萬條失敗案例)上用信用分配 SFT 從失敗軌跡中挑出有價值的推理片段訓練,並用平衡自適應 Rollout 機制把正負反饋比例控制在 0.375 至 0.625 之間,最終在 SWE-Bench Verified 拿下 67.5% 解決率,創同規模開源模型新紀錄
  • Orchard GUI 讓僅 40 億參數的 Qwen3-VL-4B 模型,僅用 400 條示範軌跡加上約 2200 個真實網頁任務的強化學習,在 WebVoyager、Mind2Web 等基準上達到 68.4% 成功率,反超 2350 億參數的大模型,關鍵在於真實沙箱環境提供的即時物理回饋比靜態截圖蒸餾更有效
  • 長周期任務實驗 Orchard Cloud 讓主智能體學會主動召喚子代理處理繁雜子任務、再壓縮上下文,使長周期任務成功率從 59.6% 提升到 73.9%;但整套架構深度依賴重型 Kubernetes 集群,對個人開發者或小型實驗室門檻仍偏高

金句

哪有什麼歲月靜好,全是底層系統在負重前行。
24:05
環境正在成為 AI 下一步進化的真正槓桿。
24:45
探索碰撞 ↗

快速浏览

项目动态墙搜索

深度探索

系列知识图谱碰撞
关于联系我
繁简EN日
字号