// Claude Opus 4.8 · Technical Guide · 2026

Claude Opus 4.8
完整技術指南

Anthropic 目前對外可用的最強模型(generally available)。一次升級五件事:長程 agentic coding、effort 校準、工具觸發可靠度、誠實度,以及和 Opus 4.7 完全相同的價格。本指南以官方第一手為權威骨幹整理。

Effort Control Dynamic Workflows Fast Mode Mid-conv System Adaptive Thinking
claude-opus-4-8發布 2026-05-281M context128k output
最後更新 2026-05-29
↗ NotebookLM
① 點 PDF 匯出檔案,或 Copy Link 複製網址 ② 開 NotebookLM →「新增來源 → 網站」貼上,加入你的筆記本
// 目錄
  1. 規格快覽 · 五大功能 · 三個常見誤解
  2. Effort Control(用力程度控制)
  3. Dynamic Workflows(動態工作流)
  4. Fast Mode(2.5× 快速模式)
  5. Mid-conversation System Messages
  6. Adaptive Thinking + Prompt Engineering
  7. 基準對比 · 4.6→4.7→4.8 軌跡
  8. 選型決策樹 · Effort 矩陣
  9. 定價(標準 vs Fast Mode)
  10. 立刻開始 · 4.7→4.8 遷移
  11. 資料來源 · 資料邊界
// 01

規格快覽與五大功能

Opus 4.8 是幅度溫和但方向明確的升級:訴求不是「更聰明」的單點突破,而是「更可靠的協作者」——把推理、工具與誠實度三條線同時校準,價格不變。

API model ID
claude-opus-4-8
Context window
1M token(預設)於 Claude API / Bedrock / Vertex AI;Microsoft Foundry 發布時為 200k。與 4.7 相同上限。
最大輸出
128k output tokens。
Thinking 模式
僅支援 adaptive thinkingthinking:{type:"adaptive"})。不支援 budget_tokens,設定即回 400
Effort 預設
high(所有介面,含 API 與 Claude Code)。
定價(標準)
$5 / 1M input$25 / 1M output。與 4.7 一致,未漲價。
不支援參數
temperature / top_p / top_k 設非預設值即回 400(沿用 4.7)。
🎚️

Effort Control

控制單則回應投入多少推理;所有介面預設 high。

⚙️

Dynamic Workflows

Claude Code 並行數十~數百 subagent,自我驗證後合併。

Fast Mode

同模型同品質,最高 2.5× 吞吐;價格為前代 fast 的 1/3。

🧩

Mid-conv System

對話中途插入 system 指令,不重寫整段 system prompt。

🧠

Adaptive Thinking

非新參數;4.8 改的是校準:只在該輪需要時才觸發推理。

⚠️

三個容易誤解的釐清:(1)Adaptive thinking 不是 4.8 新參數——4.6 引入、4.7 已是唯一模式,4.8 改的是校準。(2)Effort「參數」≠ Effort「Control」——API 的 effort 自 4.6 就有;4.8 真正新的是 claude.ai / Cowork 的 Effort Control UI,及所有介面預設 high。(3)Mid-conversation system messages 才是 4.8 真正的 API 新能力

🔑

誠實度是 4.8 著墨最深的維度:對自己寫的程式碼,漏判缺陷的機率約為 4.7 的 1/4(約 4 倍改善);更傾向主動標示不確定性、較少無證據宣稱;misaligned 行為顯著低於 4.7,接近最佳對齊的 Mythos Preview。對錯誤成本高的場景(cross-model triangulation、補助文件審查)比 benchmark 分數更實用。

// 02

Effort Control(用力程度控制)

🎚️

Effort Control — 決定 Claude 對一則回應投入多少 effort

RESPONSE TUNING
能做什麼
調節推理深度、token 花費、工具呼叫行為與回答完整度。官方明確指出 effort行為訊號,不是嚴格 token 預算。
使用介面
claude.ai 與 Cowork 模型選單旁的控制(所有方案皆可用);API/Claude Code 用 output_config.effort
適合誰
想在速度/成本與品質/深度間明確取捨的所有使用者。
預設值
Opus 4.8 在所有介面預設 high

Effort 級別(API / Claude Code)

級別API 值行為建議場景
Lowlow簡單問題可能跳過思考分類、查詢、短子任務
Mediummedium視情況思考成本敏感但需穩定品質
High(預設)high幾乎一定思考複雜推理、一般高價值任務
Extraxhigh更多 token 換更好結果30 分鐘以上長程 agentic
Maxmax最深思考無 token 約束的前沿任務

關鍵實務

  • coding 上,high 花費的 token 量與 4.7 預設相近,但表現更好
  • 官方建議:困難任務與長程非同步 workflow 用 extra(xhigh
  • Claude Code 已調高 rate limit 以容納高 effort。
  • 推理過淺:直接調高 effort,而非用 prompt 繞過
# 一般高價值任務:預設 high 即可,視需要拉到 xhigh / max resp = client.messages.create( model="claude-opus-4-8", max_tokens=4096, output_config={"effort": "high"}, # low / medium / high / xhigh / max messages=[{"role": "user", "content": "Analyze monolith vs microservices trade-offs."}], )
// 03

Dynamic Workflows(動態工作流)

⚙️

Dynamic Workflows — 單一 session 內並行數十~數百 subagent

CLAUDE CODE · PREVIEW
能做什麼
針對單一 agent 一次跑不完的超大任務,由 Claude 動態撰寫編排腳本,並行調度數十到數百 subagent,並在結果回到你面前前先自行驗證
使用介面
Claude Code CLI / Desktop / VS Code 擴充;亦支援 API、Bedrock、Vertex AI、Foundry。
方案 / 開關
Max、Team、API 預設開啟;Enterprise 發布時預設關閉(admin 啟用)。
侷限
research preview;token 耗用遠高於一般 session,建議先用 scoped 小任務試水溫。

運作機制(協調發生在對話之外,任務再大計畫都不跑偏)

01

動態規劃 · 拆解子任務

把大型問題拆成可平行處理的工作流,協調腳本獨立於對話脈絡運行。

02

並行 fan-out

同時派生數十~數百 subagent 從不同角度解題;另有 reviewer / 對抗 agent 嘗試推翻。

03

合併前驗證

每個發現跑獨立驗證、過濾假陽性;未收斂則退回重新規劃。

04

單一協調答案 + 進度存檔

回報一個整合答案;進度持續存檔,中斷可從斷點續跑,可延伸數小時至數天。

啟用方式

  • 直接叫 Claude「Create a workflow」。
  • 或開 Claude Code 設定 ultracode(effort 選單):effort 設 xhigh 並讓 Claude 自動決定何時動用 workflow;搭配 auto mode 最佳。
  • 首次觸發時會顯示即將執行內容並要求確認;admin 可透過 managed settings 停用。
🎯

規模實例(官方):Jarred Sumner 用 Dynamic Workflows 把 Bun 從 Zig 移植到 Rust——測試套件 99.8% 通過、約 75 萬行 Rust、從首次 commit 到 merge 僅 11 天(尚未上 production)。文件:code.claude.com/docs/en/workflows

// 04

Fast Mode(2.5× 快速模式)

Fast Mode — 同一個模型,最高 2.5× 輸出吞吐

CLAUDE API · PREVIEW
能做什麼
request 設 speed:"fast",從同一個 Opus 模型取得最高 2.5 倍 output tokens/秒。
品質
同模型、同品質,只是更快——不是較弱的模型。
定價
$10 / 1M input$50 / 1M output(標準的 2 倍)。較前代 fast($30/$150)便宜約 3 倍。
侷限
獨立 rate limit,超限回 429+retry-after;fast 降級回 standard 時 prompt cache 會 miss。
# Fast Mode 為 beta,需帶 betas header resp = client.beta.messages.create( model="claude-opus-4-8", max_tokens=1024, speed="fast", betas=["fast-mode-2026-02-01"], messages=[{"role": "user", "content": "Summarize this incident report."}], ) print(resp.usage.speed) # "fast" or "standard"
💡

成本敏感的高量背景任務:先用真實流量比較吞吐與帳單再決定,別只看「便宜 3 倍」的相對宣稱。

// 05

Mid-conversation System Messages ★ 真正的 API 新能力

🧩

Mid-conversation System — 對話中途插入 system 指令

MESSAGES API · NEW
能做什麼
messages 陣列中、緊接某 user turn 之後插入 role:"system",於長對話中途追加/更新具 system 權重的指令。
為何重要
不必重述整段 system prompt;前段未變故保留前面 turn 的 prompt cache 命中,降低 agentic loop 的 input 成本與延遲。
模型限制
僅 Opus 4.8 支援
平台限制
Claude API 與 Claude Platform on AWS 支援;Bedrock、Vertex AI、Foundry 不支援
快取策略
不要修改既有的 mid-conversation system message;指令變更時追加新的一則。無需 beta header。
resp = client.messages.create( model="claude-opus-4-8", max_tokens=1024, system="You are a code review assistant. Be concise.", messages=[ {"role":"user", "content":"Review process() in utils.py."}, {"role":"assistant", "content":"The comprehension is fine for small inputs."}, {"role":"user", "content":"Now review the calling code."}, {"role":"system", "content":"From now on, every suggestion must include explicit type annotations."}, ], )
// 06

Adaptive Thinking + Prompt Engineering

🧠

Adaptive Thinking — 唯一支援的 thinking 模式,搭配 effort 控制深度

REASONING

4.8 的 adaptive thinking 行為

  • 只在該輪需要時才觸發推理:簡單查詢/短 agentic 步驟直接回答。
  • 相同 effort 下,bimodal 工作負載的浪費 token 比 4.7 更少
  • 預設仍是關閉:未顯式設 thinking:{type:"adaptive"} 就不思考。
  • adaptive thinking 自動啟用 interleaved thinking,無需 beta header。

從舊版遷移(官方範例)

# Before(4.6 或更早)—— 4.8 上會回 400 thinking = {"type":"enabled", "budget_tokens":32000} # After(4.7 與之後) resp = client.messages.create( model="claude-opus-4-8", max_tokens=64000, thinking={"type":"adaptive"}, output_config={"effort":"high"}, )

結構化 Prompt 準則

準則內容
不可調取樣參數temperature/top_p/top_k 設非預設 → 400。省略,改用 prompt 引導。
高 effort 給足 max_tokensxhigh/max 下從 64k 起跳;看到 stop_reason:"max_tokens" 就調高或降 effort。
推理過淺調 effort別繞 prompt。必要時加:「Think carefully before responding.」
Thinking display⚠️ 4.8 的 display 預設值未在來源明確;顯式設定,不假設。

誠實性導向輸出格式(高錯誤成本場景強烈建議)

# 把「事實/推論/假設/未驗證」分欄,而非只輸出結論 Output format: 1. Verified facts 2. Inferences 3. Assumptions 4. Unsupported/uncertain 5. Validation done 6. Remaining validation

// 07

基準對比與 4.6 → 4.7 → 4.8 軌跡

官方主表為圖檔,數值由官方 footnote 與二手來源(9to5Mac、officechai)交叉確認。衝突數據一律採官方口徑並標註分歧。

Opus 4.8 vs 4.7 vs 競品(官方發布對比)

能力 / 基準Opus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
Agentic coding(SWE-bench Pro)69.2%64.3%58.6%54.2%
Terminal coding(Terminal-Bench 2.1)¹74.6%66.1%78.2%70.3%
Computer use(OSWorld-Verified)²83.4%82.3%78.7%76.2%
Browser agent(Online-Mind2Web)³84%低於 4.8低於 4.8
推理(HLE,含工具)57.9%54.7%
金融分析(Finance Agent v2)⁴53.9%51.5%
Knowledge work(GDPval-AA, Elo)189017531769

¹ 全部採 Terminus-2 public harness;官方 footnote 記 GPT-5.5 在 Codex CLI harness 下為 83.4%。這是 4.8 唯一未居首的主要基準。
² Opus 4.7 OSWorld 經官方重新校正為 82.3%;二手 officechai 報 82.8%,本表採官方值。
³ 84% 出自官方合作夥伴實測證言,未公開對手精確分數。
⁴ Finance Agent v2 4.7=51.5% 為二手數值(官方主表未列同口徑 4.7)。

4.6 → 4.7 → 4.8 趨勢軌跡

⚠️

方法學警告:Anthropic 在後續發布修訂過部分 harness 與評分。下表僅供趨勢方向判讀,不可當同口徑精確對比

基準Opus 4.6Opus 4.7Opus 4.8口徑
SWE-bench Pro53.4%64.3%69.2%各代發布
SWE-bench Verified80.8%87.6%未列於 4.8 主表4.8 改以 Pro 為頭條
HLE(無工具)40.0%46.9%49.8%各代發布
OSWorld-Verified72.7%82.3%(修訂)83.4%4.8 footnote
GDPval-AA(Elo)17531890各代發布

判讀:coding 與 computer use 單調上升;4.7→4.8 增幅小於 4.6→4.7——4.8 是「精修」而非「跳躍」。最大明確提升為 Terminal-Bench 2.1(+8.5pp)與 GDPval-AA(+137 Elo)。

🔑

更上層模型:Anthropic 另有 Claude Mythos Preview,能力高於 Opus,但目前僅在 Project Glasswing 下開放給少數組織做資安用途。因此 Opus 4.8 是當前對外可用的最強模型,非 Anthropic 內部最強。

// 08

我該怎麼選?決策樹與 Effort 矩陣

🌿 選型決策樹

agentic coding / computer use / 多工具編排為主
直接升級(價格不變、增益明確)
高自主、長程任務(數十分鐘以上)
升級 + xhigh + Dynamic Workflows
需要低延遲 / 串流 / 快速 agent loop
啟用 Fast Mode
終端機自動化為主
先實測 Terminal-Bench 類再遷移
錯誤成本高、需模型老實標不確定性
升級 + 誠實性導向輸出格式(§06)

Effort × Thinking 選擇矩陣

任務類型thinkingeffort理由
簡單分類 / 短摘要不啟用或 adaptivelow降低延遲與成本
一般文件分析 / 單步修改adaptivemedium~high平衡品質與成本
複雜 bug huntadaptivehigh~xhigh需工具呼叫與多步推理
大型 refactor / migrationadaptivexhigh長程代理與多輪驗證
高風險架構 / 安全審查adaptivexhigh~max需更深推理與完整驗證
// 09

定價(標準 vs Fast Mode)

標準價格與 Opus 4.7 完全相同;Fast Mode 為 research preview。

模式Input / 1MOutput / 1M說明
標準$5$25與 Opus 4.7 一致,未漲價
Fast Mode$10$50同模型同品質,最高 2.5× 吞吐;preview
(對照)前代 Fast$30$150Opus 4.6 / 4.7 fast — 故 4.8 fast 便宜約 3 倍

Prompt cache 最低門檻降到 1,024 token;mid-conversation system messages 可保留 cache 命中,進一步壓低長 agentic loop 的 input 成本。

// 10

立刻開始:4.7 → 4.8 遷移

已在 4.7 上跑的程式碼無需改動即可在 4.8 執行;以下為「行為改變、非破壞性變更」的優化清單。

PATH A — API / Pipeline 開發者
  1. 改 model ID,移除 budget_tokens 與取樣參數
  2. thinking:adaptive + 顯式 display
  3. 依矩陣設 effort,高 effort 拉高 max_tokens
  4. 長對話導入 mid-conv system messages 省 cache
PATH B — Claude Code 重度使用者
  1. 預設 high,困難切 xhigh
  2. 大型 bug hunt / migration 用 ultracode + Dynamic Workflows
  3. 先以 scoped 小任務試 workflow,注意 token 警告
  4. 搭配 auto mode;關鍵 PR 仍跑跨模型 review
PATH C — claude.ai / Cowork 使用者
  1. 用 Effort Control 調 effort
  2. 日常調低省 token;難題拉到 extra / max
  3. 高錯誤成本任務用「事實/推論/假設」分欄輸出
  4. 遇過度謹慎時加一行假設授權
// 附錄

資料來源與資料邊界

以官方第一手為權威骨幹整理;二手僅作交叉佐證。

官方第一手 / Primary

〈Introducing Claude Opus 4.8〉:anthropic.com/news/claude-opus-4-8
〈What's new in Claude Opus 4.8〉:platform.claude.com/docs/.../whats-new-claude-4-8
〈Adaptive thinking〉/〈Effort〉/〈Fast mode〉/〈Mid-conversation system messages〉:platform.claude.com/docs/en/build-with-claude/…
〈Dynamic workflows in Claude Code〉:claude.com/blog/introducing-dynamic-workflows-in-claude-code

二手交叉佐證 / Secondary

9to5Mac · officechai · TechCrunch(Dynamic Workflows / Mythos)

未能驗證 / Caveats

• SWE-bench Verified 官方同口徑 4.8 分數未在主表列出。
• OSWorld 4.7 存在 82.3%(官方修訂)vs 82.8%(officechai),本指南採官方值。
• Finance Agent v2 4.7(51.5%)來自二手;4.8 的 thinking display 預設未明確,建議顯式設定。
關於 · 編輯原則與方法論