全部模型

Claude Opus 4.8

Anthropic最新的旗艦。2026年5月28日發布,智能體程式設計更強,動態工作流可以並行鋪開數百個子智能體,快速模式便宜3倍,常規價格與Opus 4.7持平。

1M tokens · Text / Vision / Code · Prompt cache

Claude Opus 4.8是Anthropic在2026年5月28日發布的旗艦,以同樣的$5/$25廠商標價直接升級Opus 4.7。它拿下了Anthropic迄今最高的SWE-bench Pro(69.2%)、OSWorld-Verified(83.4%)、MCP-Atlas(82.2%)和Humanity's Last Exam(帶工具57.9%)成績,也是第一個在法律智能體全透過標準上突破10%的模型。

值得了解的結構性變化有兩處:一是動態工作流(先規劃任務,再在同一個會話裡並行鋪開數百個子智能體),二是快速模式降價,2.5倍速度下每100萬token $10/$50——比之前Claude模型的快速模式便宜三倍。effort等級擴充為high(預設)、extra和max。Anthropic自己把這次發布定性為「溫和但實在的改進」,而不是一次飛躍。

Claude Opus 4.8是什麼?

2026年5月28日

有兩處結構性變化對Okou使用者影響較大。第一是動態工作流:模型可以先規劃一項任務,再在同一個會話裡把它鋪開給數百個並行子智能體,Anthropic把這描述為邁向「一次執行完成數十萬行程式碼級別遷移」的一步。第二是2.5倍速度的快速模式現在是每100萬token $10 / $50——比之前Claude模型的快速模式便宜三倍。effort等級擴充為三檔:high(預設)、extra(在Claude Code裡叫xhigh)和max。

第三方解讀(LLM Stats、VentureBeat、Vellum)印證了它相對4.7和競品的排序:在Anthropic公佈的對比表裡,除Terminal-Bench 2.1之外每一格都是4.8勝出,那一格仍由GPT-5.5領先(78.2%對4.8的74.6%)。從4.7到4.8,SWE-bench Pro提升4.9個百分點,USAMO 2026提升27.4,新增的100萬token GraphWalks長上下文F1提升27.8。絕對分數只作方向性參考——SWE-bench Verified在所有前沿模型上都已接近飽和。

Claude Opus 4.8有什麼特別之處

架構與能力上的主要亮點。

Opus 4.8沿用Opus 4.7的100萬token上下文視窗和128K最大輸出,整個視窗都按標準輸入價計費。effort控制擴充為三檔:high(新的預設值)、extra(在Claude Code裡叫xhigh)和max。Messages API現在允許在對話中間插入system條目而不破壞提示詞快取。動態工作流讓Claude可以在同一個會話裡規劃並派發數百個並行子智能體。快速模式以約2.5倍的標準速度執行,每100萬token $10 / $50。文字、視覺、程式碼的多模態輸入保持不變。

規格速覽

系列Claude 4代
模態文字、視覺、程式碼
語言以英語為主,支援多語言
提示詞快取支援(Anthropic)
上下文視窗100萬token
最大輸出最多128K token
effort等級High(預設)/ Extra / Max
廠商標價每100萬token輸入$5 / 輸出$25(快速模式$10/$50,2.5倍速度)

Claude Opus 4.8基準測試

以下為Anthropic的Opus 4.8系統卡公佈的廠商成績,對比物件是Opus 4.7、GPT-5.5和Gemini 3.1 Pro,均在max檔effort下取5次試驗的平均值。Anthropic公佈的七格里4.8贏下六格;Terminal-Bench 2.1仍由GPT-5.5保持領先。SWE-bench Verified在所有前沿模型上都已接近飽和——更難的SWE-bench Pro題集才是更經得起時間檢驗的訊號。

SWE-bench Verified廠商公佈;高於Opus 4.7的87.6%
88.6%
SWE-bench Pro領先全場(4.7:64.3%,GPT-5.5:58.6%,Gemini 3.1 Pro:54.2%)
69.2%
Terminal-Bench 2.1高於4.7在2.0上的66.1%;這一項由GPT-5.5以78.2%領先
74.6%
OSWorld-Verified(電腦操作)領先全場(4.7:82.8%,GPT-5.5:78.7%)
83.4%
Online-Mind2Web(瀏覽器智能體)廠商公佈
84%
MCP-Atlas高於Opus 4.7的77.3%
82.2%
BrowseComp(單智能體)高於Opus 4.7的79.3%
84.3%
GraphWalks長上下文F1(100萬token)高於Opus 4.7的40.3%
68.1%
Humanity's Last Exam(帶工具)不帶工具為49.8%;領先全場
57.9%
GPQA Diamond與4.7持平——在前沿模型上已飽和
~93%
USAMO 2026(數學)高於Opus 4.7的69.3%
96.7%
GDPval-AA(知識工作)領先(4.7:1753,GPT-5.5:1769)
1890 Elo
Finance Agent v2領先全場
53.9%
法律智能體全透過第一個突破該標準的模型
>10%

Claude Opus 4.8價格

服務商標價,按每100萬token計。

輸入$5.00
輸出$25.00
快取讀取$0.50
快取寫入$6.25

Claude Opus 4.8實際用起來怎麼樣

來自生產環境智能體執行的實際觀察。

動態工作流

這次最重頭的新能力。Opus 4.8可以先規劃一項任務,再在同一個會話裡跑數百個並行子智能體——Anthropic把它定位為通往「一次執行完成數十萬行程式碼級別遷移」的路徑。在Okou上,這意味著單次智能體執行就能編排過去需要外部排程才能完成的扇出工作。

一次就改對的程式碼

Anthropic稱,Opus 4.8在評審程式碼時漏看缺陷的機率大約只有4.7的四分之一,而SWE-bench Pro上4.9個百分點的提升(69.2%對64.3%)在更難、更不飽和的程式設計題集上印證了這一點。需要一次補丁乾淨地落在很多檔案上時,選4.8。

長上下文召回

100萬token下的GraphWalks F1從40.3%跳到68.1%——這是本次發布中單項提升最大的一個。100萬token的視窗在高位區間現在是真能用了,而不只是紙面上有。

誠實度與過度自信

Anthropic稱,相比4.7,過度自信減少了十倍以上;不加甄別地報告有問題的結果的比例為0%(Claude家族首次做到);未把重要事件上報給使用者的比例為3.7%。失準發生率約為1.9,基本與Anthropic對齊得最好的Mythos Preview持平。

速度與快速模式

標準速度與Opus 4.7相當。真正的變化在價格:2.5倍速度的快速模式每100萬token收費$10 / $50,比之前Claude模型的快速模式便宜三倍。在掛鐘延遲要緊的編排環節值得一用。

提示詞注入的注意事項

Anthropic的系統卡指出,4.8對智能體提示詞注入的抵抗力略弱於4.7——Gray Swan紅隊測試顯示攻擊成功率約9.6%,4.7為6.0%。在會接觸不可信輸入的流水線裡跑4.8的團隊,應該重新檢查自己的沙箱方案。

Claude Opus 4.8最適合的智能體任務

過去要花一個迭代週期的程式碼庫級遷移

把一次牽涉幾百個檔案的遷移交給Opus 4.8——換ORM、升框架大版本、在monorepo裡全量修安全問題——讓動態工作流在一個會話內把活鋪給並行子智能體。SWE-bench Pro上4.9個百分點的提升,加上程式碼評審漏看缺陷減少到四分之一,正是在這類執行裡兌現價值的地方。

真正扛得住的100萬token調研

把一份200頁的合同草案、三家競爭對手的方案和上個季度的法律意見一起放進視窗,再讓Opus 4.8標出每一條比市場慣例更苛刻的條款。100萬token下GraphWalks從40.3%跳到68.1%,正是這類跨文件綜合分析開始變得可靠的原因。

不會謊報工作的智能體編排者

把4.8當成規劃者:它把一個請求拆成十步,分派給更便宜的子智能體,再彙報結果。不加甄別地報告有問題的結果比例為0%,加上過度自信下降十倍,正是生產團隊在智能體的自述必須可信時選擇4.8的原因。

終於能靠快速模式算得過賬的低延遲流程

2.5倍速度的快速模式,過去的價格是現在的三倍(每100萬token $10/$50,對比之前的檔位)。對互動式副駕、值班摘要,或者任何掛鐘延遲主導體驗的環節來說,快速模式下的4.8現在是Claude家族裡的預設選擇。

什麼時候不該用Claude Opus 4.8

大批次的常規工作別用Opus 4.8,Sonnet 4.6用零頭的成本就能達到同樣的質量水準;對延遲要求極高的聊天回覆也別用,Kimi K2.7 Code快得多;終端裡的智能體程式設計同樣繞開它,GPT-5.5在Terminal-Bench 2.1上仍然領先(78.2%對4.8的74.6%);沒有沙箱卻要攝入不可信輸入的流水線也不適合——4.8對提示詞注入的抵抗力略弱於4.7。

Claude Opus 4.8與其他模型對比

Claude Opus 4.8對比GPT-5.5

在Anthropic的對比表裡,Opus 4.8贏下七格中的六格,差距最大的是SWE-bench Pro(69.2%對58.6%)和OSWorld-Verified(83.4%對78.7%)。Terminal-Bench 2.1仍由GPT-5.5領先(78.2%對74.6%)。跨檔案程式設計和電腦操作類智能體選4.8;工作以終端驅動為主時,專門選GPT-5.5。

Claude Opus 4.8對比Gemini 3.1 Pro

Opus 4.8在SWE-bench Pro(+15.0)和OSWorld-Verified(+7.2)上大幅領先。在GPQA Diamond這類已經飽和的科學類基準上,兩個模型的差距還在誤差範圍內。做智能體類工作預設選4.8;只有當你需要Google那套工具整合方案時,才考慮Gemini。

結論:你該用Claude Opus 4.8嗎?

Claude家族裡新建智能體的新預設選擇。能安排重新驗證時就從4.7遷過來;全新的工作直接用它。下面一層繼續用更便宜的主力Sonnet 4.6。

常見問題

Claude Opus 4.8是什麼時候發布的?

Anthropic在2026年5月28日發布Opus 4.8,距離Opus 4.7只隔了41天。目前它已經在各款Claude產品、Claude API(模型ID為claude-opus-4-8)、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry和Okou上可用。

Opus 4.8的價格和4.7比怎麼樣?

常規價格完全一樣:輸入5美元/100萬token,輸出25美元/100萬token,快取輸入0.50美元/100萬token。變化在快速模式:現在是輸入10美元、輸出50美元每100萬token,速度提升到2.5倍——只有此前Claude模型快速模式價格的三分之一。

什麼是動態工作流?

這是一項新能力:Opus 4.8可以先規劃一個任務,再在同一個會話裡並行跑幾百個子智能體。Anthropic把它定位為通往「一次智能體執行完成數十萬行程式碼庫級遷移」的路徑。

Opus 4.8支援哪些思考強度檔位?

三檔:high(新的預設值)、extra(在Claude Code裡叫xhigh)和max。檔位越高,模型在給出回答前花在推理上的token越多;檔位越低,越偏向速度和速率限制下的效率。

Opus 4.8支援提示詞快取嗎?

支援。快取輸入按0.50美元/100萬token計費,快取部分相當於打了一折。Messages API現在還允許在對話中途插入system條目,而不會讓快取失效。

替代選擇

在Okou上使用Claude Opus 4.8

在Okou上使用Claude Opus 4.8的兩種方式

Okou既支援把Claude Opus 4.8作為Built-in模型使用、按Okou積分計費,也支援你用Anthropic API key自帶金鑰接入。Built-in這條路走的是Okou Managed路由和下文說明的價格檔;自帶金鑰這條路由上游服務商直接向你收費,完全跳過Okou的積分換算。

Okou的建議

Okou把Claude Opus 4.8定位為核心智能體模型,用於編排、涉及程式碼的工作,以及其他一旦答錯代價很高的環節。

積分與$$$價格檔

Okou給每個Built-in模型都定了四檔積分價格——$$$$$$$$$$——它會作為標記出現在模型選擇器裡,也出現在zero model lsprice tier那一行。Claude Opus 4.8屬於$$$。這一檔決定你從Okou積分餘額里扣掉多少;上表裡的服務商標價,則是上游服務商在Okou把它換算成積分之前收取的費用。

自May 28, 2026起在Okou上可用。