智能与秩序
5 倍性能!AI 的“双层自进化”架构与 Karpathy 基准上的惊人实验
摘要
解析一篇在 Karpathy 提出的 GPT 預訓練自動研究基準上進行的雙層自動研究實驗:讓大型語言模型不只執行研究循環(調整超參數、跑實驗),還能修改研究循環本身的搜尋機制。實驗顯示完整雙層架構比傳統自動研究循環的平均改進高出約五倍,關鍵突破來自 AI 自行寫出禁忌搜索管理器程式碼,逼迫自己跳出對大批次量的先驗執念。
重点
- 三層架構:第一層執行普通實驗搜尋、中間層每五次迭代凍結反覆失敗的參數、最上層每兩個外層週期觸發一次,讓語言模型讀取原始碼與歷史軌跡並生成新的機制模組動態熱加載
- 完整雙層架構平均改進達負零點零四五,是傳統自動研究循環(負零點零零九)的約五倍;拿掉中間策略層仍有明顯提升,證明真正的突破來自最上層機制生成而非中間管理層
- 案發現場分析:純執行層的模型因先驗認知批次量越大越好連續二十多次嘗試同一無效方向;最上層生成的禁忌搜索程式碼把這條路徑物理攔截,逼迫模型探索降低批次量的方向,最終讓收斂速度大幅提升
- 實驗環境設計嚴謹:固定驗證切片防作弊、快速失敗機制節省無效嘗試算力、關閉程式語言垃圾回收等細節優化、只給模型關鍵指標而非完整日誌
- 局限:去掉中間策略層的版本波動極大,曾發生生成程式碼因缺少必要套件而注入失敗,若無異常捕捉機制可能導致訓練集群全盤崩潰;目前僅在小模型與單張顯卡上驗證,能否推廣到千億參數集群未知
- 對工程啟發:讓 agent 學會修改自己的工具箱而非只優化模型本身、要能觀察並分析自己失敗的軌跡、優秀的自動優化系統也要懂得刪除無用機制,不只會增加
金句
大模型用代碼封死了自己的退路,從而逼出了最優解。
真正的自我進化,不是在固定規則裡不斷地刷經驗,而是讓系統擁有修改規則本身的能力。