智能與秩序

解析 UNC/CMU/Stanford 等联合力作:如何打造靠谱的科研 Agent

YouTube2026/07/13

摘要

解析 UNC、CMU、Stanford 等機構聯合發表的論文,探討如何打造真正可靠的科研 agent。論文把自主研究系統重新設計成一個有明確分工的科研團隊:假設生成階段由冒險家、務實派、挑刺者三種角色辯論產生假設;執行階段引入具備根因診斷與微調或轉向決策的自癒執行器;結果分析階段透過數值登記表與四層引用驗證機制大幅降低幻覺數字與虛構引用;並透過人機協作模式與跨輪次的教訓存儲庫,讓系統從失敗中持續累積經驗。

重點

  • 假設生成階段用三個角色辯論(冒險家、務實派、挑刺者)取代單一模型自問自答,實驗發現最佳合成假設數量為三十個時效果最佳,太多太少都會降低品質
  • 自癒執行器會依複雜度評分將簡單實驗內部解決、複雜實驗交給外部編碼專家,失敗後先診斷根因再決定微調或換方向,大幅提升代碼執行分數
  • 結果分析過去是整個流程最弱的一環(早期系統得分僅零點二六一),導入數值登記表與四層引用驗證後,全自動模式提升到零點四四二、人機協作模式達零點五二三,整體提升超過一倍
  • 人機協作消融實驗測試七種模式,協作模式拿到最高平均品質與接受率,遠勝全自動與事必躬親的逐步模式
  • 真實案例:全自動模式跑出所有策略偏差方差全部為零的正確廢話論文,人機協作模式下人類導師只多問一句是否真的存在差異,系統立即調整方向並產出有科學價值的對比結論
  • 跨輪次教訓存儲庫使用帶時間衰減權重(預設半衰期三十天)的自然語言教訓,疊加到後續提示詞中,不需重新訓練模型即可讓系統跨項目持續累積經驗

金句

誠實比聰明更重要,求真比高產更昂貴。
9:49
大模型本質上是一個文本引擎,而不是與真理引擎。
11:05
探索碰撞 ↗

快速瀏覽

專案動態牆搜尋

深度探索

系列核心概念知識圖譜碰撞
關於聯絡我
繁简EN日
字級