知能と秩序
Grok = Fable ? Cursor、Colossus 与 Grok 4.7 训练飞轮
要約
分析 xAI 發布 Grok 4.6 的意義:綜合智能指數從上一代大幅躍升,追平部分頂尖模型,但在真實軟體工程與終端操作場景仍落後領先者。影片認為真正值得關注的不是單一分數,而是 SpaceX 與 xAI 正在把代碼入口(收購 Cursor)、大規模算力(向 Anthropic 出售資料中心容量)與訓練軌跡(把模型訓練重心從答案轉向軌跡)串成一條逐漸閉合的產業鏈,這可能是比模型分數更關鍵的競爭優勢來源。
要点
- Grok 4.6 綜合智能指數大幅提升,追平部分頂尖競品,較上一代明顯進步
- 能力地圖並不均衡:在複雜知識工作與法律場景評測領先,但在真實軟體工程與終端操作評測明顯落後,顯示綜合分數與真實編碼執行能力是兩種不同的聰明
- xAI 官方強調訓練重心從答案像不像轉向幹活式像不像,透過篩選重新生成的監督微調軌跡(agent 框架、STEM、軟體工程、知識工作)並自動篩掉有問題的軌跡
- 產業鏈三環正在閉合:Cursor(代碼入口,能看見真實開發者工作流數據)加上向 Anthropic 出售大規模 GPU 算力容量,加上長程 agent 訓練重心,形成可能縮短迭代週期的完整鏈條
- API 定價公開,但作者強調真正該關注的是完成同一任務的總成本(含重試次數),而非單一 Token 單價
- 馬斯克宣稱 Grok 將被訓練在全部 SpaceX 資訊之上,作者認為這代表模型訓練重心正從讀過的網路文本轉向看見真實世界工作過程的數據(過程數據、環境數據、帶反饋的動作數據)
引用
模型競爭正在從誰的答案更像人,走向誰能更持續地在真實環境裡做事、檢查、學習、再做事。
你真正應該盯住的,就從來不應該只是一張價格表,而是完成同一件事到底花了多少錢、多少時間和多少次返工。