知能と秩序
AI 模擬預測領域全景:83 億虛擬人格、兩種商業模式與三大難題
要約
《矽谷101》這集從馬斯克的模擬假說切入,梳理「AI 社會模擬」這條新領域:它模擬的最小單位不是原子或物體,而是一個完整的人,關心的是人接收什麼輸入、會做出什麼行動。研究路線從 2023 年史丹佛小鎮的 25 個智能體,一路走到對齊真人的 1,052 個數位分身、自發長出經濟與宗教的 Project Sid,以及號稱建構 83 億人格的評估基礎設施 MatrAIx。商業上分成「賣模擬」(產品測試、社會關係測試)與「賣預測」兩條路,後者又分 Simile 的高保真個體路線與 Aaru 的群體快速路線,估值動輒 10-20 億美元,但營收仍只在數千萬美元級。真正的瓶頸是精度對齊、預測無法事前驗證的黑箱悖論,以及規模放大後指數上升的算力成本。
要点
- 定義邊界:機器人與自駕做物理模擬、世界模型以分子原子為顆粒,AI 社會模擬則以「完整個體」為最小單位,只看輸入與整體輸出行為。
- 精度路線:2024 年史丹佛把實驗擴到 1,052 個智能體,每個對應一位真實美國成年人,靠約兩小時深度訪談「蒸餾」出數位分身,問卷答案與真人兩週後作答的相似度達 85%。
- 演化路線:Project Sid 讓 1,000 多個智能體在《Minecraft》跑 12 天,自發長出經濟、文化、宗教與法律;Emergence AI 以不同底座模型建五個平行世界,Grok 世界迅速崩於混亂、GPT 世界因缺乏協作瓦解、Gemini 世界充滿暴力,Claude 與混合模型世界撐到最後。
- 評估路線:哈佛、MIT 牽頭的 MatrAIx 宣稱建構 83 億個人格(每個 1,290 個維度),在問卷、聊天、瀏覽、App 四類場景跑超過 1.8 萬次測試,400 次受控實驗中 91.5% 能遵循預設人格,目標是替模擬建立事實基準。
- 兩條預測路線:Simile(史丹佛小鎮原班人馬創辦,估值約 20 億美元)走高保真個體模擬,與 CVS 合作建 40 萬個數位分身研究服藥依從性,但每個場景都要重新訓練、難標準化;Aaru(創辦人 18、19 歲)用公開普查、授權消費、企業私有三層資料快速建模擬人群,回測 2020 美國大選誤差不到 0.5%,把兩個月的 500 人調研壓到一週。
- 驗證黑箱:預測的價值在事前,驗證卻只能事後,回測只證明擅長複製過去;Aaru 回測 2020 近乎完美,卻在 2024 年錯判賀錦麗勝選。
- 長尾與成本:SocioVerse 研究指出精度取決於環境、使用者、互動機制、行為模式四維對齊,地震、金融危機這類低頻事件缺資料;成本方面,2023 年 25 個智能體跑兩天燒掉數千美元,2025 年 100 個智能體一輪只要幾美元,但擴到百萬級且需重跑上千次時,算力仍是規模化的核心瓶頸。
- 能力曲線:Metaculus 預測錦標賽在 2025 年前沒有 AI 上榜,2025 年 6 月基於 o1 的模型首度進榜第 25 名,最新賽季前五名幾乎都是 AI;Sooth Labs 共同創辦人 Russ Salakhutdinov 甚至斷言麥肯錫、BCG 這類顧問公司都該被 AI 取代。
引用
你搭了一個劇場,然後人都在表演,但一萬個人在表演,不代表一萬個人真實能做預測。
降本的速度直接決定著「模擬未來」的野心到底能不能照進現實。
此時此刻,我們究竟是在模擬一個世界,還是正在創造一個新的世界呢?