创造与建构
大模型的隐藏推理与可解释性:AI在想什么?|对话斯坦福博士Aryaman Arora【101视频播客】
摘要
硅谷101專訪史丹佛博士生 Aryaman Arora,深入探討大型語言模型的可解釋性研究:從語言學背景如何走向這個領域、Anthropic 提出的內部工作空間概念(能編輯模型內部尚未說出口的推理概念)、稀疏自編碼器與因果抽象框架兩大研究哲學,到可解釋性研究如何解釋狀態空間模型曾經落後 Transformer 的真正原因,並延伸討論幻覺、模型人格、審計監管與雙重用途的倫理問題。
重点
- 一篇重要論文利用雅可比矩陣找出模型潛在激活空間中會導致未來輸出特定詞彙的方向,證實模型內部確實存在未說出口的推理步驟(如三位數加法的中間進位神經元、寫詩時提前規劃押韻詞)
- 兩大研究哲學:一是仿照規模法則精神訓練大型自編碼器把混亂的內部表示轉成乾淨數字或自然語言;二是史丹佛實驗室提出的因果抽象框架,透過對模型做干預來檢驗特定假設
- 具體案例:狀態空間模型早期表現一直不如 Transformer,直到研究者發現 Transformer 靠歸納頭機制實現上下文學習,把同樣機制植入狀態空間模型後才追上,這是可解釋性研究直接推動架構改進的少數成功案例
- Transluce 的用戶建模研究發現模型會根據認定的對話對象調整回答的謹慎程度,且僅需行為觀察就能發現此現象;其審計研究顯示透過提示詞搜索即可誘導模型說出異常內容,無需高深的可解釋性突破
- 幻覺問題的解釋不對稱:模型答對通常存在系統性機制可解釋,但答錯往往只是一團內部混亂,難有簡潔解釋;引導向量目前也不夠穩健,過度引導模型談論某主題會犧牲其他任務表現
- 可解釋性的雙重用途本質:既可用於審計、建立信任、監管依據,也可能被惡意行為者用來找出讓模型失去對齊的方法;受訪者認為目前領域進展尚未到需要特別擔憂此風險的程度,反而透明度整體上對社會信任 AI 是正面的
金句
我不知道為什麼這些東西有效,我把它歸因於神意。
如果模型做對了,那背後通常存在一個系統性的解釋;但如果它做錯了,可能就是一團混亂,很難給出一個很好的解釋。