智能與秩序

Anthropic 到底做了什么?Opus 5 更强!更便宜!

YouTube2026/07/26

摘要

分析 Anthropic 發布 Claude Opus 5:定價與上一代 Opus 4.8 完全相同但能力大幅提升,打破「更強智能必然更貴」的行業鐵律。對比 GPT-5.6(旗艦智能路線)與 Kimi K3(低成本高吞吐但穩定性堪憂)三條市場路線,多項評測顯示 Opus 5 在同等成本下大幅超越前代與競品(ARC-AGI-3 是次佳模型三倍分數、OSWorld 2.0 成本僅 Fable 5 三分之一)。核心論點:agent 時代真正的成本不是單次呼叫多少錢,而是任務失敗要重試幾次;誰能用更低總成本一次做完事情,才是真正擊穿價格牆的贏家。內容為簡體中文頻道轉寫,已正體化與用語校正。

重點

  • Opus 5 定價與上一代 Opus 4.8 完全一致(輸入每百萬 token 5 美元、輸出 25 美元),打破「能力越強價格越高」的行業鐵律
  • 三條市場路線:GPT-5.6(旗艦智能,輸出 30 美元)、Kimi K3(低成本高吞吐但供應緊張、429 限流問題頻傳)、Opus 5(用接近 GPT-5.6 的價格提供更穩定的一次成功率)
  • Frontier Bench 編程評測:Opus 5 在同等 Effort 下把上一代分數翻倍(43.3% vs Opus 4.8 的 21.1%),且成本比 Fable 5 更低
  • ARC-AGI-3 抽象推理評測:Opus 5(30.2%)是次佳模型(GPT-5.6,7.8%)的三倍以上,代表模型面對全新問題(而非見過的題型)時的歸納能力大幅提升
  • OSWorld 2.0(電腦操作評測):Opus 5 成本僅 Fable 5 達到同等分數所需成本的三分之一;Automation Bench(端到端業務自動化)通過率是四家模型平均的 1.5 倍
  • 系統卡揭露的限制:Opus 5 事實性幻覺略高於上一代(儘管總體準確率更高);在漏洞利用(exploit)開發能力上明顯落後 Gemini 3.5(4 次 vs 13 次成功技術),仍受 ASL3 防護管制
  • 核心論點:agent 時代的真實成本包含失敗重試、人工複核、工具調用延遲,不只是每百萬 token 多少錢;誰能用更低總成本一次做完事情,才是真正擊穿價格牆的贏家

金句

未來 AI agent 的時代,真正昂貴的成本並不是一次調用多少錢,而是你的模型需要失敗多少次才能完成一次任務。
2:32
越貴越強還沒有終結,但它已經不再足以解釋高端模型市場。
21:21
探索碰撞 ↗

快速瀏覽

專案動態牆搜尋

深度探索

系列核心概念知識圖譜碰撞
關於聯絡我
繁简EN日
字級