智能与秩序

“出炉即冻结”?大模型终身学习架构 DMoE ,让 AI 每天都在变强!无损 KV-Cache,推理延迟暴降 3.5 倍

YouTube2026/08/16

摘要

拆解一篇提出解耦混合專家模型(DMoE)架構的論文,主張大型語言模型的知識注入不需要在檢索增強生成與微調之間二選一。DMoE 把路由器與專家模組完全從凍結的基座模型剝離,用 BM25 關鍵字檢索取代向量檢索觸發知識載入,並將專家模組只掛載在最後一層前饋網路上,因此能在完全復用 KV 快取的情況下達到近乎無損的推理效率,實驗顯示比動態檢索增強生成方案快三點五倍、顯存少四成。

重点

  • DMoE 將約二萬七千餘篇維基百科段落各自訓練成獨立的 LoRA 專家模組,平時存在磁碟上不佔用顯存,透過 Token 不確定性(熵值)偵測模型何時需要外部知識求助
  • 採用 BM25 詞彙比對而非向量檢索來匹配相關知識,因為生成到一半的半成品前綴語意不完整,實驗顯示向量檢索效果反而較差且更耗顯存
  • 專家模組只掛載在模型最後一層前饋網路,因此不參與後續 Token 的注意力計算,讓所有歷史 Token 的 KV 快取完全復用、無損保留
  • 相較動態檢索方案,DMoE 延遲快三點五倍、顯存少四成;相較傳統耦合式混合專家模型,DMoE 在準確率與效率上全面勝出
  • 訓練成本低:每個知識單元訓練一個小型 LoRA,單張 A100 只需約十秒,兩萬七千多個專家總計約七十六小時 GPU 時長,且可完美並行
  • 論文侷限:磁碟輸入輸出在高併發下可能造成尾部延遲飆升;路由器高度依賴關鍵字命中,面對需要深層隱性推理、缺乏專有名詞重疊的跨領域問題時容易路由失明

金句

不要在檢票口添堵,要在最終的出戰口查驗。
10:40
把計算和存儲解耦,把通用邏輯和特定事實解耦,永遠是構建大型複雜系統的第一心法。
21:33
探索碰撞 ↗

快速浏览

项目动态墙搜索

深度探索

系列知识图谱碰撞
关于联系我
繁简EN日
字号