知能と秩序

Mythos/Fable 5 一天干完整个团队两个月的活?

YouTube 2026/06/11

要約

Anthropic 發布 Claude 5(代號 Fable),一個百萬層級參數的超大模型,標誌著新一代 AI 代理能力的突破。該模型在軟體工程、知識工作、視覺與科學研究等基準測試上超越所有前代模型,最關鍵的應用是長時間自主執行複雜任務——Stripe 實測中,Claude 5 將原本需要整個團隊兩個多月的 5000 萬行程式碼遷移工作,壓縮到一天內完成。pricing 為每百萬輸入 Token 10 美元、輸出 50 美元,雖看似高昂,但若任務夠複雜、回報足夠,成本結構遠優於人力。模型具備 Ultra Code 工作流(並行委派數百個子代理)與極高的 Token 效率,但同時也暴露出 Token 成本無上限的計算需求風險——持續投入 Token 就能持續改善輸出,這種「邊際收益」特性要求使用者進行精妙的任務路由策略。

要点

  • Claude 5 在長期複雜任務上領先:一天完成原需兩月的整個團隊工作
  • Token 計價高但需重新核算:精確評估任務難度與回報,決定何時用前沿模型
  • Ultra Code 工作流啟用並行代理:單一任務可展開數百個子代理並行執行
  • Token 成本邊際無限:持續投入 Token 就能持續改善,需警惕預算爆炸風險
  • 基準測試與主觀感受脫鉤:分數提升不必然反映實際易用性與價值感知

チャプター

  1. [0:00] Claude 5 發布與模型架構

    Anthropic 發布 Claude 5(Fable),安全版與無限版分流,百萬層級參數超大模型,能力超越前代。

  2. [0:34] 基準測試對比與解讀陷阱

    Claude 5 在多項基準測試(agentic coding、code execution、tool use)領先 GPT-4.5 與 Claude 3.5,但基準分數與主觀體驗脫鉤需警惕。

  3. [3:42] 模型能力突破:長任務自主執行

    Claude 5 在軟體工程、知識工作、視覺記憶與科學研究上表現卓越,最關鍵是長時間自主工作能力,Stripe 案例驗證。

  4. [5:40] Stripe 實測:兩月工程壓縮成一天

    Claude 5 在 5000 萬行程式碼庫中完成整體遷移從兩個月縮至一天,驗證複雜長期工程任務的極端效率提升。

  5. [4:27] 定價與成本核算邏輯

    Claude 5 輸入 10 美元、輸出 50 美元每百萬 Token,看似高昂但需按任務難度與回報重新計算投資回報率。

  6. [6:20] Ultra Code 與並行代理工作流

    Ultra Code 工作流可並行啟動數百個子代理,帶來能力倍增但 Token 預算風險指數增長。

  7. [6:58] Token 效率與邊際成本無限的悖論

    OpenAI 研究指出 Token 與質量無上限關係,持續投入 Token 就能改善輸出,但成本控制與任務路由成為關鍵運營挑戰。

  8. [7:33] 發布策略與恐懼導向行銷

    Anthropic 刻意限制 Claude 5 早期可用性以累積領先優勢,今日全面開放,展現典型的稀缺心理行銷與技術護城河策略。

引用

在一個擁有5000萬行程式碼的Ruby程式碼庫中,這個模型在一天內執行了整個程式碼庫範圍的遷移,而這原本需要一整個團隊手動工作兩個多月
5:40
如果你知道如何正確的路由任務,你將處於一個有利的位置。你需要認真思考你正在為哪個模型分配什麼任務
4:54
在思考 Token 與質量的關係上,似乎真的沒有上限。這意味著你可以繼續把 Token 砸向一個問題,它就會繼續改善輸出
6:58
Fable 5 具有超越人類以往全面推出的任何模型的能力,它在軟體工程、知識工作、視覺、科學研究和許多其他領域展現出卓越性能
3:42
衝突を探索 ↗
はじめにシリーズフィードタグ図衝突概要検索連絡
EN
文字サイズ