全部模型

Claude Opus 4.8

Anthropic最新的旗舰。2026年5月28日发布,智能体编程更强,动态工作流可以并行铺开数百个子智能体,快速模式便宜3倍,常规价格与Opus 4.7持平。

1M tokens · Text / Vision / Code · Prompt cache

Claude Opus 4.8是Anthropic在2026年5月28日发布的旗舰,以同样的$5/$25厂商标价直接升级Opus 4.7。它拿下了Anthropic迄今最高的SWE-bench Pro(69.2%)、OSWorld-Verified(83.4%)、MCP-Atlas(82.2%)和Humanity's Last Exam(带工具57.9%)成绩,也是第一个在法律智能体全通过标准上突破10%的模型。

值得了解的结构性变化有两处:一是动态工作流(先规划任务,再在同一个会话里并行铺开数百个子智能体),二是快速模式降价,2.5倍速度下每100万token $10/$50——比之前Claude模型的快速模式便宜三倍。effort等级扩展为high(默认)、extra和max。Anthropic自己把这次发布定性为「温和但实在的改进」,而不是一次飞跃。

Claude Opus 4.8是什么?

2026年5月28日

有两处结构性变化对Okou用户影响较大。第一是动态工作流:模型可以先规划一项任务,再在同一个会话里把它铺开给数百个并行子智能体,Anthropic把这描述为迈向「一次运行完成数十万行代码级别迁移」的一步。第二是2.5倍速度的快速模式现在是每100万token $10 / $50——比之前Claude模型的快速模式便宜三倍。effort等级扩展为三档:high(默认)、extra(在Claude Code里叫xhigh)和max。

第三方解读(LLM Stats、VentureBeat、Vellum)印证了它相对4.7和竞品的排序:在Anthropic公布的对比表里,除Terminal-Bench 2.1之外每一格都是4.8胜出,那一格仍由GPT-5.5领先(78.2%对4.8的74.6%)。从4.7到4.8,SWE-bench Pro提升4.9个百分点,USAMO 2026提升27.4,新增的100万token GraphWalks长上下文F1提升27.8。绝对分数只作方向性参考——SWE-bench Verified在所有前沿模型上都已接近饱和。

Claude Opus 4.8有什么特别之处

架构与能力上的主要亮点。

Opus 4.8沿用Opus 4.7的100万token上下文窗口和128K最大输出,整个窗口都按标准输入价计费。effort控制扩展为三档:high(新的默认值)、extra(在Claude Code里叫xhigh)和max。Messages API现在允许在对话中间插入system条目而不破坏提示词缓存。动态工作流让Claude可以在同一个会话里规划并派发数百个并行子智能体。快速模式以约2.5倍的标准速度运行,每100万token $10 / $50。文本、视觉、代码的多模态输入保持不变。

规格速览

系列Claude 4代
模态文本、视觉、代码
语言以英语为主,支持多语言
提示词缓存支持(Anthropic)
上下文窗口100万token
最大输出最多128K token
effort等级High(默认)/ Extra / Max
厂商标价每100万token输入$5 / 输出$25(快速模式$10/$50,2.5倍速度)

Claude Opus 4.8基准测试

以下为Anthropic的Opus 4.8系统卡公布的厂商成绩,对比对象是Opus 4.7、GPT-5.5和Gemini 3.1 Pro,均在max档effort下取5次试验的平均值。Anthropic公布的七格里4.8赢下六格;Terminal-Bench 2.1仍由GPT-5.5保持领先。SWE-bench Verified在所有前沿模型上都已接近饱和——更难的SWE-bench Pro题集才是更经得起时间检验的信号。

SWE-bench Verified厂商公布;高于Opus 4.7的87.6%
88.6%
SWE-bench Pro领先全场(4.7:64.3%,GPT-5.5:58.6%,Gemini 3.1 Pro:54.2%)
69.2%
Terminal-Bench 2.1高于4.7在2.0上的66.1%;这一项由GPT-5.5以78.2%领先
74.6%
OSWorld-Verified(电脑操作)领先全场(4.7:82.8%,GPT-5.5:78.7%)
83.4%
Online-Mind2Web(浏览器智能体)厂商公布
84%
MCP-Atlas高于Opus 4.7的77.3%
82.2%
BrowseComp(单智能体)高于Opus 4.7的79.3%
84.3%
GraphWalks长上下文F1(100万token)高于Opus 4.7的40.3%
68.1%
Humanity's Last Exam(带工具)不带工具为49.8%;领先全场
57.9%
GPQA Diamond与4.7持平——在前沿模型上已饱和
~93%
USAMO 2026(数学)高于Opus 4.7的69.3%
96.7%
GDPval-AA(知识工作)领先(4.7:1753,GPT-5.5:1769)
1890 Elo
Finance Agent v2领先全场
53.9%
法律智能体全通过第一个突破该标准的模型
>10%

Claude Opus 4.8价格

服务商标价,按每100万token计。

输入$5.00
输出$25.00
缓存读取$0.50
缓存写入$6.25

Claude Opus 4.8实际用起来怎么样

来自生产环境智能体运行的实际观察。

动态工作流

这次最重头的新能力。Opus 4.8可以先规划一项任务,再在同一个会话里跑数百个并行子智能体——Anthropic把它定位为通往「一次运行完成数十万行代码级别迁移」的路径。在Okou上,这意味着单次智能体运行就能编排过去需要外部调度才能完成的扇出工作。

一次就改对的代码

Anthropic称,Opus 4.8在评审代码时漏看缺陷的概率大约只有4.7的四分之一,而SWE-bench Pro上4.9个百分点的提升(69.2%对64.3%)在更难、更不饱和的编程题集上印证了这一点。需要一次补丁干净地落在很多文件上时,选4.8。

长上下文召回

100万token下的GraphWalks F1从40.3%跳到68.1%——这是本次发布中单项提升最大的一个。100万token的窗口在高位区间现在是真能用了,而不只是纸面上有。

诚实度与过度自信

Anthropic称,相比4.7,过度自信减少了十倍以上;不加甄别地报告有问题的结果的比例为0%(Claude家族首次做到);未把重要事件上报给用户的比例为3.7%。失准发生率约为1.9,基本与Anthropic对齐得最好的Mythos Preview持平。

速度与快速模式

标准速度与Opus 4.7相当。真正的变化在价格:2.5倍速度的快速模式每100万token收费$10 / $50,比之前Claude模型的快速模式便宜三倍。在挂钟延迟要紧的编排环节值得一用。

提示词注入的注意事项

Anthropic的系统卡指出,4.8对智能体提示词注入的抵抗力略弱于4.7——Gray Swan红队测试显示攻击成功率约9.6%,4.7为6.0%。在会接触不可信输入的流水线里跑4.8的团队,应该重新检查自己的沙箱方案。

Claude Opus 4.8最适合的智能体任务

过去要花一个迭代周期的代码库级迁移

把一次牵涉几百个文件的迁移交给Opus 4.8——换ORM、升框架大版本、在monorepo里全量修安全问题——让动态工作流在一个会话内把活铺给并行子智能体。SWE-bench Pro上4.9个百分点的提升,加上代码评审漏看缺陷减少到四分之一,正是在这类运行里兑现价值的地方。

真正扛得住的100万token调研

把一份200页的合同草案、三家竞争对手的方案和上个季度的法律意见一起放进窗口,再让Opus 4.8标出每一条比市场惯例更苛刻的条款。100万token下GraphWalks从40.3%跳到68.1%,正是这类跨文档综合分析开始变得可靠的原因。

不会谎报工作的智能体编排者

把4.8当成规划者:它把一个请求拆成十步,分派给更便宜的子智能体,再汇报结果。不加甄别地报告有问题的结果比例为0%,加上过度自信下降十倍,正是生产团队在智能体的自述必须可信时选择4.8的原因。

终于能靠快速模式算得过账的低延迟流程

2.5倍速度的快速模式,过去的价格是现在的三倍(每100万token $10/$50,对比之前的档位)。对交互式副驾、值班摘要,或者任何挂钟延迟主导体验的环节来说,快速模式下的4.8现在是Claude家族里的默认选择。

什么时候不该用Claude Opus 4.8

大批量的常规工作别用Opus 4.8,Sonnet 4.6用零头的成本就能达到同样的质量水准;对延迟要求极高的聊天回复也别用,Kimi K2.7 Code快得多;终端里的智能体编程同样绕开它,GPT-5.5在Terminal-Bench 2.1上仍然领先(78.2%对4.8的74.6%);没有沙箱却要摄入不可信输入的流水线也不适合——4.8对提示词注入的抵抗力略弱于4.7。

Claude Opus 4.8与其他模型对比

Claude Opus 4.8对比GPT-5.5

在Anthropic的对比表里,Opus 4.8赢下七格中的六格,差距最大的是SWE-bench Pro(69.2%对58.6%)和OSWorld-Verified(83.4%对78.7%)。Terminal-Bench 2.1仍由GPT-5.5领先(78.2%对74.6%)。跨文件编程和电脑操作类智能体选4.8;工作以终端驱动为主时,专门选GPT-5.5。

Claude Opus 4.8对比Gemini 3.1 Pro

Opus 4.8在SWE-bench Pro(+15.0)和OSWorld-Verified(+7.2)上大幅领先。在GPQA Diamond这类已经饱和的科学类基准上,两个模型的差距还在误差范围内。做智能体类工作默认选4.8;只有当你需要Google那套工具集成方案时,才考虑Gemini。

结论:你该用Claude Opus 4.8吗?

Claude家族里新建智能体的新默认选择。能安排重新验证时就从4.7迁过来;全新的工作直接用它。下面一层继续用更便宜的主力Sonnet 4.6。

常见问题

Claude Opus 4.8是什么时候发布的?

Anthropic在2026年5月28日发布Opus 4.8,距离Opus 4.7只隔了41天。目前它已经在各款Claude产品、Claude API(模型ID为claude-opus-4-8)、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry和Okou上可用。

Opus 4.8的价格和4.7比怎么样?

常规价格完全一样:输入5美元/100万token,输出25美元/100万token,缓存输入0.50美元/100万token。变化在快速模式:现在是输入10美元、输出50美元每100万token,速度提升到2.5倍——只有此前Claude模型快速模式价格的三分之一。

什么是动态工作流?

这是一项新能力:Opus 4.8可以先规划一个任务,再在同一个会话里并行跑几百个子智能体。Anthropic把它定位为通往「一次智能体运行完成数十万行代码库级迁移」的路径。

Opus 4.8支持哪些思考强度档位?

三档:high(新的默认值)、extra(在Claude Code里叫xhigh)和max。档位越高,模型在给出回答前花在推理上的token越多;档位越低,越偏向速度和速率限制下的效率。

Opus 4.8支持提示词缓存吗?

支持。缓存输入按0.50美元/100万token计费,缓存部分相当于打了一折。Messages API现在还允许在对话中途插入system条目,而不会让缓存失效。

替代选择

在Okou上使用Claude Opus 4.8

在Okou上使用Claude Opus 4.8的两种方式

Okou既支持把Claude Opus 4.8作为Built-in模型使用、按Okou积分计费,也支持你用Anthropic API key自带密钥接入。Built-in这条路走的是Okou Managed路由和下文说明的价格档;自带密钥这条路由上游服务商直接向你收费,完全跳过Okou的积分换算。

Okou的建议

Okou把Claude Opus 4.8定位为核心智能体模型,用于编排、涉及代码的工作,以及其他一旦答错代价很高的环节。

积分与$$$价格档

Okou给每个Built-in模型都定了四档积分价格——$$$$$$$$$$——它会作为标记出现在模型选择器里,也出现在zero model lsprice tier那一行。Claude Opus 4.8属于$$$。这一档决定你从Okou积分余额里扣掉多少;上表里的服务商标价,则是上游服务商在Okou把它换算成积分之前收取的费用。

自May 28, 2026起在Okou上可用。