知能と秩序

这个“神经符号”框架,直接抹平开源小模型与大模型的代差

YouTube2026/07/04

要約

介紹論文 AgentComp,一個神經符號混合框架,針對大型語言模型 agent 在組合泛化任務上的系統性失效提出解法。基線 agent 在困難任務首次嘗試成功率僅 3.3%,最高難度任務成功率為零;AgentComp 透過因果程式圖(CPG)、歸納邏輯規則學習(ILP)與神經定理證明器(NTP)三個組件,讓 agent 從失敗中歸納新規則、並在執行前用邏輯驗證計畫可行性,最終在所有測試模型上把成功率拉到 100%,也抹平了大小模型間的推理能力代差。內容為簡體中文頻道轉寫,已正體化與用語校正。

要点

  • 基線 ReAct 型 agent 在 RetroQuest 這個 2D 動作 RPG 環境中,困難任務首次嘗試成功率僅 3.3%,最高難度任務成功率為 0%
  • AgentComp 將首次嘗試成功率拉到 60%,樣本效率提升約 6.8 倍,且在最高難度任務上從未失敗
  • 三大組件:CPG(因果程式圖,記錄因果關係的動態地圖)、ILP(用最小對比搜尋從預測誤差中歸納新規則)、混合推理核心(LLM 負責生成候選行動、NTP 神經定理證明器負責邏輯驗證)
  • 消融實驗顯示:只留歸納學習拿掉驗證,首次成功率掉到 22.5%(雖最終成功率 91%);只留驗證拿掉學習,成功率僅 76.7%;唯有兩者兼具才能做到 100%
  • 最驚人發現:套上 AgentComp 後,千億參數大模型與幾十億參數小模型的成功率全部被拉到 100%,等於抹平了模型推理能力的代差
  • 核心啟示:LLM 應負責發散生成、符號系統負責收斂把關,記憶應結構化成可驗證的邏輯規則而非全文本紀錄
  • 侷限:RetroQuest 終究是二維遊戲環境,因果關係清晰可枚舉,真實世界因果往往多維、模糊甚至矛盾

引用

純粹的大型語言模型只有生成,它既不懂演繹也不懂溯因。
13:21
這意味著這個框架極大地抹平了模型本身的推理能力代差。
11:16
衝突を探索 ↗

さっと見る

実績フィード検索

深く読む

シリーズタグ図衝突
概要連絡
繁简EN日
文字サイズ