智能與秩序
Anthropic 到底做了什么?Opus 5 更强!更便宜!
摘要
分析 Anthropic 發布 Claude Opus 5:定價與上一代 Opus 4.8 完全相同但能力大幅提升,打破「更強智能必然更貴」的行業鐵律。對比 GPT-5.6(旗艦智能路線)與 Kimi K3(低成本高吞吐但穩定性堪憂)三條市場路線,多項評測顯示 Opus 5 在同等成本下大幅超越前代與競品(ARC-AGI-3 是次佳模型三倍分數、OSWorld 2.0 成本僅 Fable 5 三分之一)。核心論點:agent 時代真正的成本不是單次呼叫多少錢,而是任務失敗要重試幾次;誰能用更低總成本一次做完事情,才是真正擊穿價格牆的贏家。內容為簡體中文頻道轉寫,已正體化與用語校正。
重點
- Opus 5 定價與上一代 Opus 4.8 完全一致(輸入每百萬 token 5 美元、輸出 25 美元),打破「能力越強價格越高」的行業鐵律
- 三條市場路線:GPT-5.6(旗艦智能,輸出 30 美元)、Kimi K3(低成本高吞吐但供應緊張、429 限流問題頻傳)、Opus 5(用接近 GPT-5.6 的價格提供更穩定的一次成功率)
- Frontier Bench 編程評測:Opus 5 在同等 Effort 下把上一代分數翻倍(43.3% vs Opus 4.8 的 21.1%),且成本比 Fable 5 更低
- ARC-AGI-3 抽象推理評測:Opus 5(30.2%)是次佳模型(GPT-5.6,7.8%)的三倍以上,代表模型面對全新問題(而非見過的題型)時的歸納能力大幅提升
- OSWorld 2.0(電腦操作評測):Opus 5 成本僅 Fable 5 達到同等分數所需成本的三分之一;Automation Bench(端到端業務自動化)通過率是四家模型平均的 1.5 倍
- 系統卡揭露的限制:Opus 5 事實性幻覺略高於上一代(儘管總體準確率更高);在漏洞利用(exploit)開發能力上明顯落後 Gemini 3.5(4 次 vs 13 次成功技術),仍受 ASL3 防護管制
- 核心論點:agent 時代的真實成本包含失敗重試、人工複核、工具調用延遲,不只是每百萬 token 多少錢;誰能用更低總成本一次做完事情,才是真正擊穿價格牆的贏家
金句
未來 AI agent 的時代,真正昂貴的成本並不是一次調用多少錢,而是你的模型需要失敗多少次才能完成一次任務。
越貴越強還沒有終結,但它已經不再足以解釋高端模型市場。