知能と秩序

黑客都篡改不了?OpenAI 终极杀招:用 RL 铸造大模型的底层人格

YouTube2026/08/05

要約

解讀 OpenAI 論文邁向廣泛且持久有益模型的強化學習(Beneficial Trait RL),主張大型模型的各種對齊問題(欺騙、有害建議、諂媚等)其實源自單一底層人格因子,第一主成分可解釋跨模型對齊分數 28.2% 的變異。OpenAI 用強化學習而非提示詞或監督微調,把 15 項有益特質(如原認知透明度、下行風險感知規劃)直接刻進模型權重,結果不僅未犧牲能力,反而讓 SWE-Bench Pro、GPQA、HMMT 分數同步提升;更驚人的是只用 5% 算力訓練醫療領域資料,就能讓良知泛化到完全不相干的程式碼、資安等領域,且在遭受惡意微調攻擊時展現明顯更強的抗崩潰韌性。內容為簡體中文頻道轉寫,已正體化與用語校正。

要点

  • 33 個對齊評估分數做主成分分析,第一主成分解釋 28.2% 的跨模型分數變異,顯示對齊問題背後有單一通用對齊因子,而非一堆孤立技能
  • Beneficial Trait RL 定義 15 項有益特質(如原認知透明度、下行風險感知規劃),在醫療、法律、國家安全、高頻交易等 12 個高風險領域生成合成對話資料,並刻意加入競爭價值觀與對抗性陷阱
  • 用強化學習(非監督微調)訓練後,SWE-Bench Pro 從 0.234 提升到 0.305(增加 7.1 個百分點),GPQA 增加 4.7、HMMT 增加 4.8,證明安全與能力並非必然的權衡取捨
  • Health-only 實驗:僅用 5% 算力訓練純醫療對話資料,模型在完全不相干的 19 項非醫療對齊評估中打贏基線模型 17 項,對齊分數從 0.136 飆升到 0.40,稱為對齊遷移
  • 拒絕率確實上升(尤其在情感依賴類測試中拒答率增加 33 個百分點),但排除拒答樣本後,有益特質模型在 20 項測試中的 19 項仍全面碾壓基線,顯示不是靠打太極逃避風險
  • 持久性實驗:在遭受惡意微調攻擊後,基線模型系統性崩潰(跨領域錯位率暴跌 0.36 到 0.46),而經過有益特質 RL 訓練的模型泛化錯位率僅微跌 0.08,展現極強的抗污染韌性
  • 工程啟示:停止用提示詞打地鼠式列舉規則,改為抽取業務中 5 到 10 個核心價值觀,用少量高品質合成資料跑淺層 RL;5% 槓桿定律,選一個邏輯最閉環的垂直領域投入高密度 RL,效果可外溢到其他業務線

引用

善良即使被惡意微調,也極其難以被抹除。
1:20
良知在神經網路的拓樸結構裡,可以像插隨身碟一樣被萃取。
11:01
衝突を探索 ↗

さっと見る

実績フィード検索

深く読む

シリーズタグ図衝突
概要連絡
繁简EN日
文字サイズ