Intelligence & Order
AI 内部的“隐藏地图”被破解,1494种越狱全是一个套路 (AUTOSKILL解读)
Summary
解讀維吉尼亞理工大學團隊提出的 AutoScale 論文,主張用自然語言操控大型語言模型是一種工程幻覺;研究改用主成分分析拆解模型的內部激活空間,找出模型自行組織的技能軸,發現不同模型對同一項技能在激活空間中的坐標系甚至完全相反,證明人類技能分類與模型內部技能組織存在系統性錯位。更關鍵的發現是 1494 種表面上互不相同的越獄攻擊提示詞,在模型激活空間裡投影後高度重疊,代表安全對齊真正該覆蓋的是激活空間裡的少數方向,而非在文字表面窮舉多樣性。
Key points
- 研究用三步驟拆解模型技能:抽取每層隱藏狀態並拼接、對序列做平均池化得到高維表示、再用主成分分析分解出主要方向作為技能軸,每個軸有正負兩極代表相反傾向
- LLaMA 的激活空間中符號微積分與離散數學推理落在同一主成分軸的正負兩端;Qwen 對同一項符號微積分技能的坐標方向卻與 LLaMA 完全相反,顯示不同模型各自發展出獨立的技能地圖
- 系統提示詞文件的效果好壞,取決於人類定義的技能分類與該模型內部技能組織方式是否巧合對齊,因此同一份提示詞在不同模型上效果差異很大
- 可直接在推理時把代表某項技能的引導向量疊加到殘差流中,不需寫提示詞、不需微調就能精確干預模型行為,論文稱之為推理時引導
- 收集 32 個家族、共 1494 種越獄攻擊提示詞,投影到激活空間後發現觸發的向量高度重疊,代表表面上花樣百出的攻擊話術,在模型眼中其實是同一件事,被壓縮進極少數的幾個激活軸
- 因此傳統靠文字多樣性做紅隊測試或篩選訓練資料的做法效率低下,AutoScale 改用最遠點採樣在激活空間裡找覆蓋最廣的方向,在低資料量下的安全對齊效果顯著優於隨機選擇
- 論文代表的範式轉移方向是表徵工程:從外部用提示詞與腳手架規範模型行為,轉向直接讀取並操縱模型內部激活空間的幾何結構
Quotes
1494 種各不相同的人類越獄話術,在模型的激活空間裡觸發的向量高度重疊;你不是在跟 AI 博弈,你是在跟自己製造的幻覺搏鬥。
你是在用人類的地圖,給一個在外星球長大的人導航。