创造与建构
“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场
摘要
探討 AI 推理基礎設施(AI Infra)為何成為千億美元新市場:當大模型競爭從訓練轉向部署,GPU 利用率成為關鍵瓶頸,卡內基梅隆大學研究發現推理場景中高達 52%到65% 的能耗被浪費在執行時空轉上。節目拆解 AI Infra 四層架構(能源、計算硬體、系統軟體、服務編排),並以 SGLang 孵化出的新創公司 RadixArk 為例,說明 KV Cache 復用、連續批次處理、Prefill/Decode 分離等技術如何把榨乾硅的極限變成新的商業戰場。內容為簡體中文頻道轉寫,已正體化與用語校正。
重点
- 卡內基梅隆大學對 756 塊 GPU 做 31 天遙測,發現整體約 20% 執行時間與 11% 能耗浪費在執行時空轉,Azure Code 負載空轉能耗高達 65%、OpenAI Chat 類請求達 52%
- AI Infra 分四層:能源基礎設施、計算硬體、系統軟體(CUDA、編譯器等)、服務編排(vLLM、SGLang 等),近年創新最密集的是上面兩層軟問題
- SGLang 的 RadixAttention 用基數樹組織 KV Cache,讓跨請求、跨機器共享前綴快取,Anthropic 曾靠類似優化把成本砍掉 90%
- 連續批次處理(Continuous Batching)取代排隊制與批處理,讓 GPU 吞吐量提升 2 到 4 倍;Prefill/Decode 分離把讀題與逐字作答拆到不同 GPU,是英偉達 Dynamo 框架的核心設計
- AI 推理平台 Baseten 一年估值從 21 億美元漲到 130 億美元,Fireworks 七個月估值翻四倍達 175 億美元;SGLang 與 vLLM 前後腳完成超過一億美元種子輪融資
- RadixArk 除了推理引擎 SGLang,也推出訓練框架 Miles,把強化學習所需的推理與訓練交替放進同一系統設計,目標是讓任何公司都能擁有前沿實驗室等級的推理能力
金句
你以為 GPU 很忙嗎?其實大多數時間 GPU 是很閒的。
我們做 RadixArk 一個更大的目的,其實就是希望以後就不要有前沿實驗室這個詞,因為人人都可以做前沿實驗室。