知能と秩序
碾压 Claude!7B开源小模型成功率暴涨15倍, AI Agent 神作 StraTA
要約
StraTA 論文提出針對 AI Agent 的核心痛點——「走一步忘一步」的健忘症——進行結構化解決。其核心哲學為「先畫地圖再出發」:在任務開始前讓模型生成全局戰略規畫,然後將此規畫作為「紧箍咒」約束後續每一步執行動作。論文結合分層 GRPO 強化學習、幾何算法實現多樣性策略採樣、以及 AI 自我審查機制,成功讓 7B 參數小模型在複雜決策測試中超越 Claude Sonnet,在購物任務上將成功率從 5.3% 提升至 84.2%。這代表強化學習而非提示詞工程,才是打造真正自主智能體的關鍵。
要点
- AI Agent 反應式決策的根本缺陷:短視探索、無意義折返、內在不一致,源於自迴歸架構的短期主義本質。
- 分層 GRPO 在戰略層和執行層分別評分,精確解決信用分配問題,讓模型清楚知道哪層需要改進。
- 最遠點採樣算法保證四個候選戰略在語義空間上天差地別,避免同質化假思考,提供豐富對比信號。
- LM as a Judge 自我審查機制挑出既不遵守戰略又無實質推進的廢話步驟,實現微觀層級的負面強化。
- 應用層可不花算力成本地實裝:在 workflow 頂端加全局戰略規畫節點,將生成策略硬焊進後續 Agent 的 prompt,立即減少 50% 跑偏概率。
チャプター
- [0:00] AI Agent 的健忘症困境
揭示當前 Agent 的普遍痛點:雖然努力運轉但記不住初心,執行與規畫脫節,導致複合指令失敗。
- [2:37] Agent 發展三條路與信用分配難題
回顧提示詞工程、工具調用、強化學習三個技術路徑,指出 Agentic RL 面臨的核心瓶頸:稀疏獎勵下無法判斷多步動作中哪一步該負責。
- [5:49] 反應式決策的病根診斷
對比人類規畫式決策,診斷大模型自迴歸架構導致的短視探索、無意義折返、內在不一致等痼疾。
- [8:17] StraTA 的破局哲學:先畫地圖再出發
介紹核心創新:先生成全局戰略再執行,將策略規畫與動作執行解耦成軍師與士兵的兩層架構。
- [10:14] 三大工程創新:分層 GRPO、多樣性採樣、自我審查
詳解分層評分解決信用分配、最遠點採樣保證戰略多樣性、LM as Judge 挑出廢話步驟的機制。
- [17:33] 實驗成果與破紀錄表現
展示 StraTA 訓練 7B 模型在購物任務上成功率從 5.3% 飆升至 84.2%,在 Sightboard 測試超越 Claude Sonnet。
- [20:09] 應用層與模型層的落地建議
給開發者兩層建議:應用層可免費加全局規畫節點,模型層應轉向仿真環境與強化學習而非人工標註。
- [21:57] 框架局限與哲學反思
指出固定策略無法應對動態環境變化、虛擬沙盒與真實網路有維度差異,以及 StraTA 背後的深層哲學:願景性智能。
引用
這就是我們現在用 AI Agent 時最普遍的也是最痛的感受,他每一秒都在極其努力的決定我現在該幹嘛,但他就是記不住我最初到底是為了幹嘛。
StraTA 的核心哲學一句話就能講透:那就是不要讓模型直接根據當前狀態去瞎猜下一步動作,在任務正式開始之前先逼著模型根據初始狀態生成一份全局策略。
從 5.3% 到 84.2%,這不是簡單的成績及格,這是從完全沒法用到可以直接僱用的質變。
真正的智能是建立一種叫做願景性的東西,是在大腦中構建一個尚未發生的在未來的願景,並且在通往這個願景的漫長的充滿誘惑的充滿挫折的道路上,用這個願景對抗每一個當下的局部最優解。
人類標的數據是有天花板的而且極其昂貴,去構建好的仿真環境吧,去寫好的打分規則吧,只要你的環境足夠真實,用類似 StraTA 這種分層 GRPO 加上自我反思的框架,把模型扔進去,給它足夠的算力,它自己就能在這個世界裡悟出比人類教導還要高明的辦事策略。