创造与建构
谷歌核心AI科学家:“大语言模型和世界模型都是错误路线”
摘要
Andrew Dai 離職谷歌後提出核心觀點:單純擴展大語言模型的規模無法通向 AGI,因為 LLM 依賴語言思維鏈而無法真正理解物理世界(例如無法準確數數)。他認為世界模型路線也存在侷限——學術研究過度強調視覺,卻忽視動物具備視覺之外的智能。他主張的突破方向是整合「語言推理 + 視覺推理」的多模態模型,以同時具備邏輯推理能力與物理世界感知。相比之下,OpenAI、DeepMind 和 Anthropic 聚焦程式設計能力開發,因為程式設計市場龐大且具備自我改進潛能,但這導致他們對多模態視覺推理的重視程度不足,形成差異化競爭機會。
重点
- 語言模型規模擴展不足以達成 AGI,因模型無法準確理解物理世界規律
- 世界模型研究被視覺中心主義主導,忽略動物智能超越視覺的證據
- 多模態推理(語言+視覺)結合才能產生具有廣泛應用能力的 AI 模型
- 前沿實驗室聚焦程式設計能力競賽,對多模態視覺推理投入不足
- 遞迴自我改進透過程式設計突破成為業界爭取 AGI 競速的核心策略
章节
- [0:00] 語言模型的侷限:為何 LLM 規模擴展不足
Andrew Dai 指出大語言模型儘管思維鏈越來越長,但本質上無法理解物理世界運作規律,表現為無法準確計數等基本視覺任務失敗。
- [0:30] 世界模型研究的學術困境
學術界對世界模型的研究受視覺中心主義驅動,過度強調視覺而忽視其他智能維度,包括 Geoffrey Hinton 等大牌科學家的視覺優先論。
- [0:56] 多模態推理的突破方向
提出整合語言推理與視覺推理的多模態方案,才能產生具備邏輯推導與物理世界感知能力的通用 AI 模型。
- [1:26] 前沿實驗室的程式設計競賽策略
OpenAI、DeepMind、Anthropic 聚焦程式設計能力開發,將遞迴自我改進作為 AGI 競速的路徑,導致對多模態視覺推理重視不足。
- [2:23] 市場機會與競爭格局
Dai 認為多模態推理是當前最佳機會,預估 DeepSeek 可能是競爭對手但方向不明確,其他實驗室競爭壓力導致忽視此領域。
金句
光是大語言模型、無法將我們帶到 AGI。光靠擴展語言部分,還是不夠了解我們的世界
現在這些模型都不會數東西。所以我覺得你光擴展這個語言部分,還是不夠了解我們的世界
要把語言推理加上視覺推理,才可以做到一個模型,可以幫助所有的行業
他們越來越偏程式設計的方向。程式設計這個市場很大,他們也覺得做一個很好的程式設計模型,就可以有遞迴自我改進
前沿實驗室都不想第二達到 AGI,都想第一。所以其實他們有很多壓力做一個更好的程式設計模型,所以他們就不是很看重多模態視覺推理這個問題