从计划到行动:智能体在多大程度上遵循计划?
Summary
本影片分析了 DeepSeek-R1 等推理模型在代碼修復任務中「不遵循計畫」的現象。研究透過三個維度量化 AI 的「聽話指數」:計畫覆蓋率、執行順序、計畫外行為。結果顯示推理能力最強的 DeepSeek-R1 聽話指數最低,但解決問題成效反而更高。關鍵發現是:一個有缺陷的計畫對 AI 的負面影響,大於完全沒有計畫。這不是 AI 叛逆,而是不完整的計畫將 AI 困在死循環。更深層問題在於:透過 Prompt 工程強制執行計畫已經走到死局,強大的推理模型會無視細緻的步驟指令,因為計畫遵循能力根植於訓練層,而非 Prompt 層。解決之道是轉向微調 AI 的計畫遵循能力,而非依賴系統 Prompt。
Key points
- 推理能力越強的模型聽話指數越低,DeepSeek-R1 最不遵循標準四步計畫但解決率反而高。
- 有缺陷的計畫比無計畫更有害,AI 試圖遵循錯誤計畫時會被困在死循環無法自由迂迴。
- 計畫遵循能力是訓練中內化的肌肉記憶,即使刪除 Prompt 也會依然執行,無視顯性指令。
- GPT-4o Mini 展現自適應策略,簡單問題跳過驗證步驟,複雜問題完整執行,突破僵化計畫。
- Prompt 工程已死局,未來需轉向微調強化計畫遵循紀律,而非依賴系統提示詞指導。
Chapters
- [0:00] DeepSeek-R1 的悖論:最強推理模型卻最不聽話
介紹影片核心發現:推理能力最強的 DeepSeek-R1 在代碼修復任務中聽話指數最低,卻解決更多問題。揭示背後隱藏的真相:被賦予的計畫可能從一開始就是錯的。
- [1:11] 建立測量框架:三把尺子量化 AI 聽話程度
說明研究的標準四步計畫及三個測量維度:計畫覆蓋率、執行順序、計畫外行為,組合成綜合聽話指數 Plan Compliance Score。
- [2:31] 四個模型對比結果:聽話指數與解決率的反直覺關係
揭示實驗結果:DeepSeek-R1 聽話指數最低,GPT-4o Mini 聽話指數次低但表現自適應策略,DeepSeek-More 聽話指數最高但解決能力未必最強。
- [3:07] DeepSeek-R1 的真相:不是叛逆,是格式崩潰
揭示 DeepSeek-R1 不遵循計畫的根本原因:強化學習只優化短期獎勵,導致 API 呼叫格式錯誤,無法在長線計畫中保持格式完整,如同多動症患者無法耐心排隊。
- [4:26] GPT-4o Mini 的聰明:基於難度的自適應策略
介紹 GPT-4o Mini 根據問題難度動態調整行為:簡單問題跳過複現步驟,複雜問題執行完整流程。這是智慧優化而非不聽話,但突破了僵化計畫。
- [5:03] 最恐怖的發現:壞計畫比無計畫更有害
核心發現:無計畫時 AI 表現更優,因為完全自由迂迴;有缺陷計畫時 AI 被困死循環,在遵循與發現矛盾間反覆掙扎,消耗雙倍資源。
- [7:05] 訓練層的內化:刪除 Prompt 也改不了執行邏輯
揭示即使刪除計畫指令,DeepSeek-V3 與 DeepSeek-R1 依然執行標準四步流程。計畫遵循已內化為神經層面的肌肉記憶,Prompt 層無法改變。
- [9:35] Prompt 工程已死局:微調才是未來出路
結論:透過 System Prompt 控制 AI 執行流程已失效。強大推理模型無視長篇步驟指令。唯一解決方案是微調訓練 AI 的計畫遵循紀律和格式穩定性。
Quotes
它制定計畫,但是幾乎不按計畫執行。它拿到一個問題直接跳步跳過驗證,甚至有時候根本不寫測試。但它解決的問題,有時候反而比那些老老實實按計畫走的模型更多。
一個不完整的有缺陷的計畫,對軌跡的負面影響大於完全沒有計畫。AI 在嘗試遵循和發現問題之間反覆橫跳,既要處理任務本身,又要處理計畫本身的錯誤,兩頭消耗。
這些模型在訓練過程中,已經把這個計畫變成了自己內部的肌肉記憶。這不是被告知的,這是被學會的。
你寫的那個完美的計畫,可能從結構上就是錯的。而且越強大的推理模型,就越會無視它。
出路在於整個行業必須轉向遵循計畫的微調。大模型需要的是從底層操作層面學會做項目管理,而不是看你寫在系統提示詞裡的使用說明書。