智能與秩序
AI 已经会看、会说、会生成世界,但李飞飞提醒:看见 ≠ 理解
摘要
從李飛飛與神經科學家的對談出發,回顧五億年前生物開始感光演化到今天電腦視覺(從視覺皮層分層特徵研究,到 ImageNet、AlexNet 深度學習突破)的整條脈絡,反覆強調看見不等於理解:模型能從海量統計規律中生成逼真影像或文字,但這不保證擁有可驗證的物理理解或與人類相同的經驗。文中借李飛飛的空間智能、醫療 AI 副駕駛比喻,主張 AI 應該增強而非取代人類判斷,教育的重點應轉向培養提問與查核的能力。內容為簡體中文頻道轉寫,已正體化與用語校正。
重點
- 演化史線索:五億多年前生物開始感光,讓生命從被動反應轉向提前預判與主動行動,李飛飛認為視覺是智能的一塊基石
- 電腦視覺的技術史:1950 年代對哺乳動物視覺皮層的分層特徵研究啟發了神經網路的分層結構設計;ImageNet 作為集體基礎建設工程,於 2012 年前後隨深度神經網路與 GPU 算力匯流,促成 AlexNet 等里程碑,使特定任務的分類錯誤率超越當時人類水準
- 關鍵區分:模型從大量共現的視覺線索與語言描述中形成統計結構,這與人類兒童透過身體、照料關係、語言互動等多重管道形成概念的路徑並不相同,同一個答案不保證來自同一條認知路徑
- 影片生成模型能生成符合視覺期待的畫面,但這不等於擁有可在任意新環境精準預測摩擦、材料形變、長期因果後果的內部物理模擬器
- 空間智能被拆解為三個不同層次:渲染讓世界看起來合理、模擬讓世界在規則互動中接近真實、規劃與行動讓主體在不確定環境中選擇動作並承擔後果,三者互相促進但互不等同
- 醫療與科學發現案例:AI 可協助整理病史與藥物關聯,扮演副駕駛提醒醫生留意但不做最終診斷;達文西手術系統仍由經驗豐富的外科醫生在控制台前判斷與承擔責任
- 核心倡議:教育不應只教用 AI 得到答案,而應訓練學生提出好問題,並在高後果情境如醫療、法律、金融中把 AI 輸出當成待查核的輸入而非可自動執行的指令
金句
看見更多不等於理解一切,生成逼真的畫面不等於可靠地在世界中行動。
邊界不是把技術推遠,邊界是讓我們在靠近技術時,仍然知道自己是誰。