Intelligence & Order

算力越大越聪明?越贵的 AI 智能体,反而可能越难用!

YouTube07/22/2026

Summary

解讀論文《支架更新不等於支架收益》,該研究把 AI agent 的自我進化拆解成負責寫工具與規則的支架更新能力,以及負責執行任務的支架收益能力,分別評測後發現用便宜的小模型當技師寫技能包,效果幾乎等同昂貴頂級模型;而執行模型的收益曲線呈倒 U 型,中程模型收益最大,頂級模型因天花板效應收益有限,弱模型則因兩種系統性缺陷而完全吃不到紅利。

Key points

  • 研究把 AI 自我進化拆成兩種角色:負責寫新提示詞或技能補丁的進化器(技師),與負責執行任務的執行模型(車手)
  • 在 SWE-Bench、SPC-Atlas、SkillsBench 三大基準測試中,進化器的模型規模與其寫出的支架品質幾乎無關,最好與最差進化器的性能差距僅 3.1 個百分點
  • 案例:僅 90 億參數的 Qwen3-9B 寫出的技能規則,讓執行模型拿到與昂貴模型 GPT-4.6 撰寫規則相同的滿分成績,關鍵在於兩者代碼邏輯過程同構
  • 執行模型的收益呈倒 U 型曲線:頂級模型如 Claude Opus 4.6 因天花板效應只提升 2.6% 到 3.6%,中程模型如 1200 億參數的 GPT-OSS-120B、Qwen3-235B 在 SWE-Bench 上可暴增 19.3 個百分點
  • 32B 級別的弱模型罹患兩種系統性缺陷:支架激活失敗(把 JSON 指令與長篇廢話混在一起導致格式審查器拒絕,加載成功率僅 25.1% 對比強模型 96%)與支架遵循失敗(隨任務拉長,遵循指令比例從 0.52 暴跌至 0.13,甚至靜默謊報任務完成)
  • 建議把算力預算從昂貴的進化器撤下,改用免費小模型;資源集中在倒 U 型曲線中間的中程執行模型,是目前成本與性能的最佳甜蜜點

Quotes

不再盲目崇拜參數量,而是看到了搭建外部支架的精妙之處。
22:15
邏輯在暴走,經費在燃燒。
9:10
Explore collisions ↗

Quick browse

ProjectsFeed WallSearch

Deep dive

SeriesCore IdeasKnowledge GraphCollisions
AboutContact
繁简EN日
Font Size