Anthropic 目前對外可用的最強模型(generally available)。一次升級五件事:長程 agentic coding、effort 校準、工具觸發可靠度、誠實度,以及和 Opus 4.7 完全相同的價格。本指南以官方第一手為權威骨幹整理。
Opus 4.8 是幅度溫和但方向明確的升級:訴求不是「更聰明」的單點突破,而是「更可靠的協作者」——把推理、工具與誠實度三條線同時校準,價格不變。
claude-opus-4-8thinking:{type:"adaptive"})。不支援 budget_tokens,設定即回 400。high(所有介面,含 API 與 Claude Code)。temperature / top_p / top_k 設非預設值即回 400(沿用 4.7)。控制單則回應投入多少推理;所有介面預設 high。
Claude Code 並行數十~數百 subagent,自我驗證後合併。
同模型同品質,最高 2.5× 吞吐;價格為前代 fast 的 1/3。
對話中途插入 system 指令,不重寫整段 system prompt。
非新參數;4.8 改的是校準:只在該輪需要時才觸發推理。
三個容易誤解的釐清:(1)Adaptive thinking 不是 4.8 新參數——4.6 引入、4.7 已是唯一模式,4.8 改的是校準。(2)Effort「參數」≠ Effort「Control」——API 的 effort 自 4.6 就有;4.8 真正新的是 claude.ai / Cowork 的 Effort Control UI,及所有介面預設 high。(3)Mid-conversation system messages 才是 4.8 真正的 API 新能力。
誠實度是 4.8 著墨最深的維度:對自己寫的程式碼,漏判缺陷的機率約為 4.7 的 1/4(約 4 倍改善);更傾向主動標示不確定性、較少無證據宣稱;misaligned 行為顯著低於 4.7,接近最佳對齊的 Mythos Preview。對錯誤成本高的場景(cross-model triangulation、補助文件審查)比 benchmark 分數更實用。
effort 是行為訊號,不是嚴格 token 預算。output_config.effort。high。| 級別 | API 值 | 行為 | 建議場景 |
|---|---|---|---|
| Low | low | 簡單問題可能跳過思考 | 分類、查詢、短子任務 |
| Medium | medium | 視情況思考 | 成本敏感但需穩定品質 |
| High(預設) | high | 幾乎一定思考 | 複雜推理、一般高價值任務 |
| Extra | xhigh | 更多 token 換更好結果 | 30 分鐘以上長程 agentic |
| Max | max | 最深思考 | 無 token 約束的前沿任務 |
high 花費的 token 量與 4.7 預設相近,但表現更好。xhigh)。把大型問題拆成可平行處理的工作流,協調腳本獨立於對話脈絡運行。
同時派生數十~數百 subagent 從不同角度解題;另有 reviewer / 對抗 agent 嘗試推翻。
每個發現跑獨立驗證、過濾假陽性;未收斂則退回重新規劃。
回報一個整合答案;進度持續存檔,中斷可從斷點續跑,可延伸數小時至數天。
ultracode(effort 選單):effort 設 xhigh 並讓 Claude 自動決定何時動用 workflow;搭配 auto mode 最佳。規模實例(官方):Jarred Sumner 用 Dynamic Workflows 把 Bun 從 Zig 移植到 Rust——測試套件 99.8% 通過、約 75 萬行 Rust、從首次 commit 到 merge 僅 11 天(尚未上 production)。文件:code.claude.com/docs/en/workflows
speed:"fast",從同一個 Opus 模型取得最高 2.5 倍 output tokens/秒。$10 / 1M input、$50 / 1M output(標準的 2 倍)。較前代 fast($30/$150)便宜約 3 倍。429+retry-after;fast 降級回 standard 時 prompt cache 會 miss。成本敏感的高量背景任務:先用真實流量比較吞吐與帳單再決定,別只看「便宜 3 倍」的相對宣稱。
messages 陣列中、緊接某 user turn 之後插入 role:"system",於長對話中途追加/更新具 system 權重的指令。thinking:{type:"adaptive"} 就不思考。| 準則 | 內容 |
|---|---|
| 不可調取樣參數 | temperature/top_p/top_k 設非預設 → 400。省略,改用 prompt 引導。 |
| 高 effort 給足 max_tokens | xhigh/max 下從 64k 起跳;看到 stop_reason:"max_tokens" 就調高或降 effort。 |
| 推理過淺調 effort | 別繞 prompt。必要時加:「Think carefully before responding.」 |
| Thinking display | ⚠️ 4.8 的 display 預設值未在來源明確;顯式設定,不假設。 |
官方主表為圖檔,數值由官方 footnote 與二手來源(9to5Mac、officechai)交叉確認。衝突數據一律採官方口徑並標註分歧。
| 能力 / 基準 | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Agentic coding(SWE-bench Pro) | 69.2% | 64.3% | 58.6% | 54.2% |
| Terminal coding(Terminal-Bench 2.1)¹ | 74.6% | 66.1% | 78.2% | 70.3% |
| Computer use(OSWorld-Verified)² | 83.4% | 82.3% | 78.7% | 76.2% |
| Browser agent(Online-Mind2Web)³ | 84% | 低於 4.8 | 低於 4.8 | — |
| 推理(HLE,含工具) | 57.9% | 54.7% | — | — |
| 金融分析(Finance Agent v2)⁴ | 53.9% | 51.5% | — | — |
| Knowledge work(GDPval-AA, Elo) | 1890 | 1753 | 1769 | — |
¹ 全部採 Terminus-2 public harness;官方 footnote 記 GPT-5.5 在 Codex CLI harness 下為 83.4%。這是 4.8 唯一未居首的主要基準。
² Opus 4.7 OSWorld 經官方重新校正為 82.3%;二手 officechai 報 82.8%,本表採官方值。
³ 84% 出自官方合作夥伴實測證言,未公開對手精確分數。
⁴ Finance Agent v2 4.7=51.5% 為二手數值(官方主表未列同口徑 4.7)。
方法學警告:Anthropic 在後續發布修訂過部分 harness 與評分。下表僅供趨勢方向判讀,不可當同口徑精確對比。
| 基準 | Opus 4.6 | Opus 4.7 | Opus 4.8 | 口徑 |
|---|---|---|---|---|
| SWE-bench Pro | 53.4% | 64.3% | 69.2% | 各代發布 |
| SWE-bench Verified | 80.8% | 87.6% | 未列於 4.8 主表 | 4.8 改以 Pro 為頭條 |
| HLE(無工具) | 40.0% | 46.9% | 49.8% | 各代發布 |
| OSWorld-Verified | 72.7% | 82.3%(修訂) | 83.4% | 4.8 footnote |
| GDPval-AA(Elo) | — | 1753 | 1890 | 各代發布 |
判讀:coding 與 computer use 單調上升;4.7→4.8 增幅小於 4.6→4.7——4.8 是「精修」而非「跳躍」。最大明確提升為 Terminal-Bench 2.1(+8.5pp)與 GDPval-AA(+137 Elo)。
更上層模型:Anthropic 另有 Claude Mythos Preview,能力高於 Opus,但目前僅在 Project Glasswing 下開放給少數組織做資安用途。因此 Opus 4.8 是當前對外可用的最強模型,非 Anthropic 內部最強。
| 任務類型 | thinking | effort | 理由 |
|---|---|---|---|
| 簡單分類 / 短摘要 | 不啟用或 adaptive | low | 降低延遲與成本 |
| 一般文件分析 / 單步修改 | adaptive | medium~high | 平衡品質與成本 |
| 複雜 bug hunt | adaptive | high~xhigh | 需工具呼叫與多步推理 |
| 大型 refactor / migration | adaptive | xhigh | 長程代理與多輪驗證 |
| 高風險架構 / 安全審查 | adaptive | xhigh~max | 需更深推理與完整驗證 |
標準價格與 Opus 4.7 完全相同;Fast Mode 為 research preview。
| 模式 | Input / 1M | Output / 1M | 說明 |
|---|---|---|---|
| 標準 | $5 | $25 | 與 Opus 4.7 一致,未漲價 |
| Fast Mode | $10 | $50 | 同模型同品質,最高 2.5× 吞吐;preview |
| (對照)前代 Fast | $30 | $150 | Opus 4.6 / 4.7 fast — 故 4.8 fast 便宜約 3 倍 |
Prompt cache 最低門檻降到 1,024 token;mid-conversation system messages 可保留 cache 命中,進一步壓低長 agentic loop 的 input 成本。
已在 4.7 上跑的程式碼無需改動即可在 4.8 執行;以下為「行為改變、非破壞性變更」的優化清單。
claude-opus-4-8thinking:{type:"enabled",budget_tokens:N} → 改 adaptive + efforttemperature/top_p/top_keffort(預設 high);高 effort 把 max_tokens 拉到 ≥ 64kdisplay,不假設預設budget_tokens 與取樣參數thinking:adaptive + 顯式 displayeffort,高 effort 拉高 max_tokenshigh,困難切 xhighultracode + Dynamic Workflows以官方第一手為權威骨幹整理;二手僅作交叉佐證。
display 預設未明確,建議顯式設定。