知能と秩序
預訓練與後訓練:你能力的上限和下限
要約
萬維鋼《現代思維工具課》第 99 講做了一次「逆向仿生學」:用大型語言模型的訓練研究回頭理解人的學習。預訓練對應一生的經驗累積,語料比參數更關鍵,餵足之後會出現湧現與開悟,決定能力的上限;後訓練(SFT、RLHF、RLVR)對應社會化與技能打磨,研究顯示它幾乎不新增能力,只提升可靠性,也就是把 pass@k 的潛力變成 pass@1 的穩定發揮,決定能力的下限。由此看,思維工具多半是後訓練的快捷鍵,是經驗的壓縮演算法而非替代品,必須在真實情境中、有回饋地練到不佔腦力才有用。人比 AI 強的地方是沒有版本號,今天的後訓練會替你挑選明天的預訓練語料,所以學習是一個關於輸入、回饋與獎勵訊號設計的工程問題。
要点
- 類比框架:參數規模像天資,預訓練語料像讀過的書、見過的人、經歷過的事;「預測下一個詞」重複上兆次會逼出對語法、事實、因果與人情的理解。
- 語料比腦容量重要:DeepMind 2022 年 Chinchilla 研究發現,同等算力下參數較少但語料充足的模型,勝過參數大得多卻訓練不足的模型。
- 預訓練餵足會出現兩件事:湧現(規模到某量級後冒出沒人教過的能力)與開悟 grokking(2022 年 OpenAI 研究者發現模型死記硬背很久後,突然能把規律推廣到沒見過的題)。
- 後訓練三步:SFT 模仿標準問答學格式與品味;RLHF 以人類偏好為獎勵學分寸,但會帶來諂媚傾向(2023 年 Anthropic 研究)與「對齊稅」;RLVR 在程式、數學等可驗證領域只問對錯。
- pass@k 測潛力、pass@1 測發揮:2025 年清華大學黃高團隊發現,後訓練模型 pass@1 明顯領先,但 k 達數百時基座模型追平甚至反超,強化學習加的是可靠性並減少探索,而非新能力。
- 表面對齊假說的佐證:13 億參數的 InstructGPT 經後訓練在人類偏好上勝過 1750 億參數的 GPT-3;LIMA 只用 1000 條精選示範就把 650 億參數基座調成像樣助手。
- 思維工具多數是把腦中既有知識打包成自動化短程式的快捷鍵,前提是先有足夠預訓練;練法三要素為真實情境演練、必須有回饋、熟到 pass@1 ≈ 1。2019 年一項 290 名研究生的去偏誤訓練,使數週後在無提示情境下選中劣質方案的機率降低 19%。
- 人沒有版本號,權重永遠是熱的;用熟的工具(資訊價值、主動高認知負荷、非預期後果、探索與利用)會替你挑選下一批語料。獎勵訊號若選按讚與誇獎會練出諂媚,選作品與真實世界的硬回饋才能同時抬高下限與上限。
引用
預訓練決定能力的上限,後訓練決定能力的下限。
工具不是經驗的替代品,工具是經驗的壓縮演算法。
預訓練決定你偶爾能成為誰,後訓練決定你通常是誰。