創造と構築
AI 創業的規模效應:把有趣的小事推到前人沒試過的規模
要約
這篇筆記整理一場對創業課學生的談話,講者以 OpenAI 內部視角回顧規模化的決策與 ChatGPT 的誕生。核心主張是:最有價值的創新幾乎都來自規模帶來的湧現,所以當一件事在小規模已經顯得有趣,就該把它推到前人沒試過的規模——YC 擴大批次後出現的網路效應、深度學習放大模型後的能力躍升都是例子。規模化真正的阻力不只是資本與上萬張 GPU 的工程,而是人的心智模型與不擅長理解指數的直覺。ChatGPT 不是由上而下設計出來的,而是從開發者拿 API 金鑰跟模型聊天的行為中逆向發現;講者也把 AI 定位為繼電力、自來水、網路之後的新公用事業,並建議單人 AI 實驗室把力氣投向被忽視的推理層。
要点
- AI 時代的創業新範式:小團隊用負擔得起的 token 投入,就能完成過去百人頂尖工程團隊的工作,野心上限、推進速度與可並行的任務量都變了;但課堂上對講者而言「夠明顯」的點子,多半已被許多人同時想到,真機會是像當年做 AGI 那樣全球只有少數人在做的方向。
- 規模是核心變數:最有價值的創新都與規模帶來的湧現有關,至今沒有成熟理論能解釋。YC 曾被普遍建議縮到每批 10 家,實際上批次擴大後的內部網路效應才是它真正的魔力;AI 早期多數頂尖研究者認為放大模型沒有科研價值,實證恰好相反。
- 規模化的真正難點:系統故障會隨規模以不可預測的方式加速出現;把模型放到 1 萬甚至 10 萬張 GPU 上跑,需要一整個從未有人組過的工程梯隊;資本、研究資源分配分歧與風險決策要同時處理,而最難重構的是人既有的心智模型。
- 大規模團隊靠「清楚的終點+明確的路徑+全員認可的決策機制」凝聚;人類天生不懂指數成長,要用第一性原理反覆推演,直到每個人自己得出同樣結論,當年押注深度學習規模化時也因此頂住了「分散資源做多元專案」的反對。
- ChatGPT 是從使用者行為逆向發現的:GPT-3 API 在 2020 年夏天上線初期幾乎沒人注意,一個月後才靠開發者在 Twitter 自發分享擴散;多數開發者沒拿 API 做商用產品,而是用自己的金鑰跟模型聊天,這個訊號直接催生 ChatGPT。上線後連續 5 天「流量衝高回落、隔天再創新高」,依 YC 經驗判定為爆款,隨即進入兩個月的瘋狂擴容,優先保運算資源,商業模式事後再補。
- ChatGPT 之前的核心規劃是全力攻程式生成,把寫程式視為 AI 控制電腦的入口,再結合機器人操控就能在物理世界替人做事;Codex 迭代到 5.5 版迎來拐點。現行訓練管線(預訓練、中期訓練、後期訓練、RLHF 與監督回饋)未來一定會被重寫;講者提到的目標是當年 9 月前以 50 萬到 100 萬張等效 GPU 打造「AI 科研實習生」、2028 年 3 月實現能自主設計新架構的全自動 AI 研究員(原筆記未查證)。
- AI 是下一個新公用事業品類:人類歷史上新增的公用事業極少(電、自來水、網路)。電力早期直接賣「電」沒人買,改賣「夜間照明」才打開市場,AI 也需要類似的具象價值錨點;使用者只在乎可用性、成本與品質,token 是目前真正的計費單位,AI 代理普及後計費層級還會再往上抽象,就像手機使用者只看通話時數與流量。類比也有邊界:「AI 科研實習生」這類隱喻在熟悉矽谷的小圈子很有效,對全球一般使用者反而會失真。
- 給單人 AI 實驗室的方向:頂尖人才都擠在模型訓練,推理側的低成本大規模交付是投入窪地,未來所有前沿實驗室都必須在很大程度上轉型為推理服務公司。至於 LLM 路線之爭,模型能力雖不均衡(部分任務遠超人類、長週期高判斷任務仍遠不如人),但近期已有模型證偽困擾數學家多年的猜想;把自我身分綁在「scaling 行不通」上的人,在證據出現時會拒絕更新,這是身分執念阻礙認知。
引用
當某件事在小規模已展現有趣價值時,把它推到前人從未嘗試過的規模,幾乎總能收穫超出預期的結果。
團隊共識不是靠說服,是靠把底層邏輯推演到每個人都能自己得出同樣結論。