知能と秩序

斯坦福|MIT 发布 Meta-Harness:别再迷信提示词优化了!你的调试方法正在“毒害”大模型

YouTube2026/06/22

要約

解讀史丹佛、MIT 與研究團隊發表的 MetaHarness 論文,主張目前主流的提示詞優化方法(OPRO、TextGrad、AlphaEvolve)把海量除錯資訊壓縮成幾百字文字反饋,用在最佳化 harness(評測執行框架)程式碼這件事上根本行不通,因為程式碼問題需要的是逐檔逐行的細節定位,而非語意摘要。MetaHarness 反其道而行,讓一個 coding agent 直接擁有完整檔案系統存取權,自行讀取原始碼、執行紀錄與歷史候選版本進行診斷,結果在文字分類任務上把準確率從 27.4% 一口氣推到 48.6%,且消耗的 context token 只有基線的四分之一。內容為簡體中文頻道轉寫,已正體化與用語校正。

要点

  • 文字分類任務基準:Zero-shot 準確率僅 27.4%,現有 Text Optimizer 可到 40.9%,MetaHarness 達到 48.6%
  • 消融實驗最反直覺的發現:加了摘要反而比不加還差(Scores 加 Summary 最佳成績 38.7%,低於 Scores Only 的 41.3%),證明摘要會過濾掉診斷所需的關鍵細節
  • MetaHarness 三組件:完整檔案系統(保存所有歷史原始碼、執行紀錄、評分結果)、agentic proposer(用 Claude Code 這類 coding agent,一次評測平均讀取 82 個檔案、查看約 20 個歷史候選 harness)、最小化外部迴圈(診斷全部委託給 proposer 自主完成)
  • 刻意不設只能看最好結果的親代選擇規則,讓 proposer 能自由查看所有歷史犯錯紀錄,因為診斷需要的是看見所有錯誤而非只看最佳解
  • MetaHarness Full 中位數準確率 50%(最佳 56.7%),對比 Scores Only 中位數 34.6%、Scores 加 Summary 中位數 34.9%
  • 在 Terminal-Bench 2 上,MetaHarness 於 Haiku 4.5 排名第一、於 Opus 4.6 排名第二(排除未發表的 Forge Code 則為第一)
  • 侷限:單次評測 token 消耗比其他方法高出好幾個數量級;主要驗證於分類、檢索增強推理、智能體式編程場景,對純文字生成任務效果未知;效果與底層 coding agent 能力強綁定

引用

有時候你以為自己看到了全部,但其實你只是在看別人想讓你看到的那個部分。
11:11
Text Optimizer 對於 Harness 工程來說,就好比你去看醫生,醫生說你身體有問題,卻沒有然後了。
2:59
衝突を探索 ↗

さっと見る

実績フィード検索

深く読む

シリーズタグ図衝突
概要連絡
繁简EN日
文字サイズ