知能と秩序

Context-CoT:通过高质量推理合成增强上下文学习

YouTube2026/07/27

要約

解讀論文提出的 Context-CoT 框架,揭露大型語言模型在面對全新、與預訓練常識衝突的上下文時會出現的系統性失效:在專為此設計的極嚴苛基準上,當時最頂尖的閉源模型成功率僅 23.7%,開源模型平均更只有 13% 到 15%。研究團隊發現傳統思維鏈蒸餾訓練方式存在監督信號洩漏問題,教師模型提前知道正確答案,只會用舊常識做事後合理化,導致訓練出來的小模型越學越笨。Context-CoT 用三階段流水線解決此問題,讓 40 億參數小模型的成績從 9.06% 提升到 12.85%。內容為簡體中文頻道轉寫,已正體化與用語校正。

要点

  • 上下文學習與本文討論的上下文學習新知識是兩回事:前者只是激活模型已有的參數化知識,後者要求模型動態內化與固有常識衝突的全新規則,這才是論文要測試的零基礎學習
  • 測試基準包含近 2000 個複雜任務,平均上下文長度上萬 token,且解題所需知識僅存在於提示詞中,不能查網路也不能用預訓練常識,結果顯示當時最頂尖閉源模型成功率僅 23.7%,開源模型平均僅 13% 到 15%
  • 洗碗機說明書案例生動說明模型的傲慢:說明書明確寫消毒模式只用於面板與奶瓶消毒,但模型無視文件,用舊常識自行推理出消毒模式適合清洗平底鍋的錯誤結論
  • 傳統思維鏈蒸餾訓練存在監督信號洩漏:把答案一起餵給教師模型讓它反推解題過程,導致教師模型偷懶用舊知識做事後合理化,訓練出的小模型用此方法成績反而下降,等於越學越笨
  • Context-CoT 三階段流水線:強制提取相關規則、教師模型看不到答案由隱藏裁判給二元評分反饋且最多重試五次、以及用逐步對齊與推理增益兩指標挑選最適合小模型學習的教材
  • 在 40 億參數的小模型上,完整 Context-CoT 框架訓練後成績從基線 9.06% 提升到 12.85%,在另一款開源小模型上同樣取得顯著提升;消融實驗證明拿掉最小洩漏過濾模組時性能跌幅最大,證實防作弊機制是核心關鍵
  • 高品質資料量僅需約 3000 條左右即可讓性能提升明顯,不需要數十萬條海量堆疊,核心結論是防作弊的強制閱讀與認知對齊的摩擦力管理,才是未來人工智能模型進化的最底層邏輯

引用

正確性並不等於可學習性。
18:29
我們的 AI 大腦,在面對真正的新事物時,會瞬間變成一個自負的文盲。
1:49
衝突を探索 ↗

さっと見る

実績フィード検索

深く読む

シリーズタグ図衝突
概要連絡
繁简EN日
文字サイズ