智能與秩序
錯義變異致病性預測:從序列保守性到 AlphaMissense
摘要
這篇圖片筆記整理了錯義變異(單一胺基酸替換)致病性預測的問題脈絡與工具演進。臨床上最大的瓶頸是「意義未明變異」(VUS):已知的 1,640 萬種錯義變異中超過 99% 尚未完成臨床分類,而錯義變異又占致病變異約一半。預測工具從 2000 年代的序列保守性分析,一路加入蛋白質結構特徵、多工具整合的機器學習,再到 2020 年前後納入蛋白質動力學。2023 年 DeepMind 以 AlphaFold 2 的 Evoformer 為骨幹推出 AlphaMissense,對約 7,100 萬種可能的人類錯義變異完成約 89% 的分類,致病預測精確率約 90%,代表深度學習把結構預測能力直接轉成臨床解讀能力。
重點
- 問題規模:約 50% 的致病變異屬於錯義變異(HGMD,Stenson et al., 2020);在已發現的 1,640 萬種錯義變異中,超過 99% 仍是意義未明變異(ClinVar、gnomAD 資料),臨床判讀的缺口遠大於已知。
- 致病邏輯鏈:DNA 錯義變異 → 蛋白質序列改變 → 蛋白質功能異常 → 疾病表型。預測依據分三層:局部化學變化(電荷、極性、疏水性)、局部結構變化(二級與三級結構)、動力學變化(構象柔性與運動狀態);筆記以通道蛋白失去通道功能導致聽力損失為例。
- 工具演進四階段:2000 年前後 SIFT 等以序列保守性為主;2004-2008 年 PhyloP、GERP、PROVEAN 等強化多序列比對與進化保守;2012 年前後 PolyPhen-2、MutPred 等引入蛋白質結構特徵;2016 年 REVEL、BayesDel 走向多工具整合的機器學習;2020 年 Rhapsody、DynaMut 納入蛋白質動力學。
- 動力學特徵的做法是用高斯網路模型(GNM)把全原子模型簡化成粗粒度模型,計算殘基的運動特性作為預測輸入。
- 多維特徵整合的效益:Rhapsody(隨機森林)同時用序列、結構與動力學特徵時 AUROC 約 0.84,只用序列約 0.68,只用結構加動力學約 0.70(數值估算自 Ponzoni and Bahar, 2018 的圖表)。
- AlphaMissense 架構:輸入參考序列、採樣變異與多序列比對(MSA),以 AlphaFold 2 的 48 層 Evoformer 為主幹、循環 4 輪,輸出結構預測、致病分數(參考胺基酸與變異胺基酸的對數機率差)及從「最可能良性」到「最可能致病」的連續分級;原筆記稱參數量超過 9,000 萬。
- AlphaMissense 成果:對約 7,100 萬種可能的人類錯義變異中約 89% 完成分類,致病變異預測精確率約 90%;之後仍有 2024 年的 VariPred 等新工具出現,這個領域仍在快速迭代。
金句
整合多維度特徵可顯著提升預測性能
DNA 發生錯義變異 → 蛋白質序列改變 → 蛋白質功能異常 → 疾病表型出現