Claude Opus 5 登場:Anthropic 兩個月內發布的第四個模型

新聞摘要
Anthropic 於太平洋時間 2026 年 7 月 24 日星期五正式推出 Claude Opus 5,將此新模型定位為其迄今為止表現最佳且最具成本效益的版本。該公司表示,Opus 5 的能力幾乎與其頂級的 Claude Fable 5 模型相當,但每 token 的成本卻減半,目前已成為 Anthropic 消費者和開發者產品中大多數用戶的預設模型。這是 Anthropic 在不到兩個月內發布的第四個模型,此前於 2026 年 6 月發布了 Claude Mythos 5、Claude Fable 5 和 Claude Sonnet 5。
定價與可用性
Claude Opus 5 的定價為每百萬輸入 token 5 美元,每百萬輸出 token 25 美元,與其前代產品 Claude Opus 4.8 相同。這意味著開發者和企業客戶無需支付額外費用即可獲得顯著的能力升級。相比之下,Anthropic 最強大的模型 Claude Fable 5 的每 token 價格約為兩倍,使得 Opus 5 成為需要強大推理能力但又不想支付高昂費用的團隊的更經濟實惠的選擇。該模型現已可透過 Claude API、AWS 上的 Claude Platform 以及包括 Amazon Bedrock 和 Google Cloud Vertex AI 在內的支援雲端合作夥伴取得。
基準測試表現
Anthropic 強調了多項獨立和內部基準測試結果,以展示 Opus 5 相較於 Opus 4.8 在能力上的飛躍:
- 在 FrontierBench v0.1 上,這是一個評估真實軟體工程工作(如多檔案變更、除錯和根據規格建構功能)的代理終端編碼基準測試,Opus 5 在最大推理努力下得分為 43.3%。相比之下,Opus 4.8 為 18.7%,Fable 5 為 33.7%,領先的競爭模型為 37.5%。
- 在 ARC-AGI-3 上,這是一個旨在測試在沒有明確規則或目標的互動式、回合制環境中新穎問題解決能力的基準測試,Opus 5 達到了 30.2% — 幾乎是排名第二的競爭模型近四倍。該基準測試專門設計用於抵抗記憶和簡單的模式匹配,獎勵能夠逐步推理不熟悉情況的模型。
Anthropic 表示,這些進步主要歸功於模型規劃和驗證自身工作方式的改進,而非僅僅是規模的擴大。
新的「努力」控制,用於平衡成本與能力
Opus 5 最顯著的新增功能之一是面向用戶的「努力」設定,它允許開發者為給定的任務或提示選擇低、中、高三個推理深度級別。較低的努力設定可以更快、更便宜地完成簡單的請求,而較高的設定則會分配更多的計算資源用於規劃、自我檢查和解決更難的問題。Anthropic 表示,這使開發者能夠精細控制回應速度、成本和準確性之間的權衡,而不是為每個請求強制執行單一固定的行為。
判斷與自我驗證
Anthropic 強調,Opus 5 在「驗證其工作並仔細迭代直至成功方面要強得多」,公司將這一轉變歸因於訓練模型在規劃過程中捕捉自身的邏輯錯誤,而不是僅在產生答案後才發現。實際上,這意味著 Opus 5 會將更多的推理過程用於檢查中間步驟是否正確以及答案為何有效,而不是簡單地產生輸出然後繼續。Anthropic 將此視為邁向更可靠的代理行為的一步 — 這對於多步驟編碼專案、數據分析和工作場所自動化等任務非常有用,在這些任務中,一個未被注意到的錯誤可能會在許多步驟中累積。
Anthropic 近期模型路線圖的背景
Opus 5 的推出是 Anthropic 在 2026 年夏季快速發布產品的一部分。在 6 月份,該公司推出了 Claude Sonnet 5,旨在平衡日常開發工作的速度和智能;同時推出了 Claude Fable 5,這是其最頂級、最昂貴的模型,用於處理最困難的推理和長遠代理任務;以及 Claude Mythos 5,這是一個透過有限研究計畫提供的專用變體。隨著 Opus 5 以不變的價格填補了產品線的中高端市場,Anthropic 在兩個月內有效地更新了其整個模型家族,這一速度反映了公司內部更快的訓練和評估週期。
對開發者和教育者的意義
對於探索應用人工智能的學生、研究人員和開發者來說,Opus 5 結合了更強大的推理基準測試和不變的定價,降低了嘗試更強大的代理系統(包括編碼助手、自動化研究工具和多步驟任務代理)的門檻,而無需增加營運成本。新的努力控制也提供了一個具體、實際的範例,說明現代語言模型如何透過分配計算資源來換取準確性,這一概念在機器學習課程和應用人工智能工程中越來越重要。