知能と秩序
潘多拉魔盒已开「大语言模型智能体中工具使用的演进:从单工具调用到多工具编排」
要約
影片深入剖析大語言模型在多工具協作中的進化——從單點工具調用升級到複雜的多工具編排。核心挑戰是當 AI 需要在動態的數位環境中同時協調成百上千個 API 時,必須突破線性思維的局限。論文揭示的關鍵架構包括:拓撲感知規劃讓 AI 能並行處理子任務並容錯重規劃;雙系統架構分離短期細節處理與長期目標守護;程序性記憶讓 AI 積累可復用的執行軌跡。在訓練上,從監督微調轉向故意餵養失敗經驗;抽象鏈策略將邏輯推理與具體檢索解耦。工程實踐層面,投機推理降低延遲、自適應模型路由控制成本。最具突破性的是,AI 開始具備邊界感知、自主編寫工具函式、動態適應環境變化的能力,從被動使用者演變為創造者。
要点
- 拓撲圖架構讓 AI 從線性執行進化為並行處理與容錯重規劃,大幅提升多工具協調效率。
- 雙系統架構分離直覺反應與深思熟慮,防止超長任務中的目標飄移與上下文遺忘。
- 抽象鏈策略先生成抽象推理骨架再填實際資料,解決邏輯推理與參數調用脫節的問題。
- 跨工具狀態污染與並發衝突構成系統級風險,需三道防線(執行前靜態約束、執行中事務管理、執行後動態驗證)。
- AI 獲得邊界感知與自主編寫工具能力,從被動工具使用者演變為主動創造者與永續自我進化的學習體。
チャプター
- [0:00] 問題提出:為什麼 AI 助理會在複雜多步任務中崩潰
以蘋果 Siri 示例展示多步票務與日曆任務,揭示大模型與動態數位環境互動時的核心缺陷。
- [2:31] 從單工具到多工具的paradigm轉移
比喻傳統模型如紙上談兵將軍,早期 React 框架如配發對講機,如今需像交響樂團指揮般協調成千工具。
- [4:40] 拓撲感知規劃與容錯重規劃機制
拓撲圖讓 AI 識別並行、順序、備選路徑;當工具失敗時觸發 Plan B,大幅提升韌性與並發效率。
- [7:20] 雙系統架構與程序性記憶
借鑑人類認知心理學,分離快速直覺與深思熟慮,引入程序性記憶防止目標飄移與上下文爆炸。
- [9:30] 新時代訓練範式:從監督微調到故意失敗學習
轉向教模型如何面對失敗、回溯與換方案;抽象鏈先架構邏輯再填資料,解決細節與大局打架問題。
- [12:27] 工程魔法與成本控制:Tool Jam、投機推理、模型路由
在底層詞典植入虛擬工具詞彙;投機推理預測性合併請求;自適應路由輕重模型,大幅降低延遲與成本。
- [13:49] 跨工具安全與系統級風險
並發衝突與跨工具狀態污染可導致提示詞注入攻擊;需三道防線與檢查點制度維護系統完整性。
- [20:29] 開放環境中的完整性與 AI 自主創造力
AI 學會邊界感知、自主編寫工具函式、動態適應環境,從被動使用者晉升為主動創造者與終身學習者。
引用
大語言模型雖然擁有驚人的參數化知識,但一旦被要求與真實的動態的時時刻刻都在發生變化的數位環境去互動的時候,他們其實就像是被死絕鎖在一個沒有網際網路的黑盒子裡面。
現實世界的任務可絕對不是查查天氣這麼簡單,你需要這位將軍立刻脫下他身上的舊軍裝,轉眼變成一位指揮著百人交響樂團的首席指揮家或者變成一家業務極其龐雜的跨國公司的 CEO。
拓撲感知賦予大模型的強大韌性——當系統監測到某一個工具調用失敗時,它會立刻觸發拓撲圖裡的或節點,這就是備用選項,它的 Plan B 甚至是 Plan C。
抽象鏈是一種極其優雅的設計,它把抽象的邏輯推理和具體的知識檢索完美解耦了,極大的降低了模型在大段文本中迷失方向的概率。
AI 在發現沒有工具可用的時候,它開始自己寫代碼來為自己製造所需的工具,這把完全客製化的螺絲起子在後台當場被鍛造出來之後,立刻交給使用者模組執行。