智能與秩序
被神化的 AI 自动化优化:为什么你的 Agent 根本“不听”别的 Agent 说话?
摘要
拆解一篇質疑主流 Prompt 自動優化框架有效性的論文:作者先用嚴謹的雙因素方差分析證明,串聯 agent 之間的 Prompt 幾乎不存在交互效應(因為 RLHF 訓練讓模型對措辭變體語意脫敏),所以聯合優化是過度設計;接著測試六種主流優化方法在 Claude Haiku 上 72 次優化裡只有 49% 贏過零樣本基線,統計上與丟硬幣無異,除非任務本身有能做但預設不做的結構化輸出需求。內容為簡體中文頻道轉寫,已正體化與用語校正。
重點
- 拆牆實驗:兩個串聯 agent 各 10 個候選 Prompt 組成 100 組合、每組跑 30 樣本做雙因素方差分析,結果所有任務、所有模型的交互效應 F 值全部小於 1、P 值全部大於 0.52,證明聯合優化的假設不成立
- 六種主流優化方法(APE、OPRO、EvoPrompt、Prompt Breeder 等)在 Claude Haiku 上共 72 次優化,只有 49%(約 35 次)贏過零樣本基線,二項分布 P 值 0.91,統計上與丟硬幣做決策沒有顯著差異
- 唯一六種方法全部顯著提升的任務是 HelpSteer2(要求輸出結構化 JSON 評分),提升達 6.8 分;其餘三個接受自由格式輸出的任務(FeedbackBench、WildBench、XSum)提升僅 0.6到1.1 分,落在噪聲範圍內
- 關鍵現象是能做但預設不做:Claude Haiku 本來就有能力生成 JSON,只是零樣本預設不這麼做,此時優化只是在補一個格式指令,而非挖掘模型真正的能力上限
- 換一個模型(Amazon Nova Lite)結果完全相反:HelpSteer2 上六種方法只有一種有效,Feedback Bench 上卻有四種有效,證明優化效果高度模型綁定,無法跨模型遷移
- 提出兩階段診斷流程取代盲目優化:花約 80 美元跑偶合測試(判斷是否需要聯合優化)加上花約 5 美元跑空間測試(判斷零樣本與最優候選的差距是否大於 2 分,決定值不值得優化),總成本約 85 美元、一天時間
金句
正是因為這個能但不用的存在,導致了所有主流的 Prompt 優化工具,在相當多的任務上,其實是在做無用功。
在你決定花多少時間優化之前,先搞清楚這個任務值不值得優化,這才是這篇論文真正值得被聽進去的原因。