Okou上的GPT-5.5。OpenAI的旗舰推理模型
OpenAI GPT-5家族的旗舰。在OpenAI这一侧,智能体编程、深度推理和计算机操作循环上最强的选择。
400K tokens · Text / Vision / Code · Prompt cache
当一项工作既要深度推理又要可靠的工具调用时,GPT-5.5就是你会去拿的那个模型:编排多步骤的智能体循环、必须一次落地的代码改动、跨越大量界面操作的计算机操作工作流。厂商基准(SWE-bench Verified、AIME 2025、GPQA Diamond)把它相对GPT-5.4的提升量化成了具体数字。
GPT-5.5是什么?
2026年4月(GPT-5.4的继任者) · GPT-5家族的顶配档。OpenAI在智能体编程与推理上的旗舰。
GPT-5.5是OpenAI GPT-5一代的旗舰,2026年4月发布,官方推荐从GPT-5.4升级过来。OpenAI把它描述成智能体工具调用和计算机操作任务上的一次台阶式提升,而不是API表面的一次翻新。GPT-5带来的40万token上下文窗口和reasoning_effort参数原样延续,现有的Codex智能体不用重写就能接上。
独立榜单(Artificial Analysis、Vellum)印证了它相对GPT-5.4的排序,并在多数智能体编程任务上把GPT-5.5放在与Claude Opus 4.7相差几分的位置。绝对分数每周都在变,OpenAI自己也提醒过前沿模型在SWE-bench Verified上存在训练数据污染。公开分数只能当方向性参考,不能当定论;更稳定的信号是那些结构化的行为差异:工具调用准确率、计算机操作的可靠性、一次成功的补丁质量。
GPT-5.5有什么特别之处
架构与能力上的主要亮点。
GPT-5.5沿用GPT-5.4的40万token上下文窗口,整个窗口都按标准输入价格计费。它支持reasoning_effort参数的四个档位(minimal、low、medium、high),支持提示词缓存——缓存输入按输入价的十分之一计费;也支持codex CLI默认使用的Responses API接口。工具调用、结构化输出和计算机操作与5.4一致。输入支持文本、视觉和代码多模态;模型本身不支持原生图像生成(要生成图片请用Images API)。
规格速览
GPT-5.5基准测试
分数由厂商公布,取自OpenAI的GPT-5.5发布材料,差值对照的是GPT-5.4的公开数字。独立评测认为在智能体编程任务上,5.5与Claude Opus 4.7相差几分。绝对百分比只作方向性参考;OpenAI已提醒所有前沿模型在SWE-bench Verified上存在训练数据污染。
GPT-5.5价格
服务商标价,按每100万token计。
GPT-5.5实际用起来怎么样
来自生产环境智能体运行的实际观察。
工具路由
GPT-5家族里工具调用走错的比例最低。相比5.4的差距,会在难的边缘情况上拉大:条件式工具选择、层层嵌套的参数,以及长段推理之后才发出的工具调用。
一次改对代码
GPT-5家族里补丁质量最强的一个。当智能体要改的代码必须持续编译通过、测试也不能挂,尤其是补丁横跨多个文件时,就该选它。厂商公布的SWE-bench Verified直接反映了这一点。
计算机操作
在多步骤的图形界面操作序列上明显比5.4可靠,OSWorld的差值抓的就是这一点。当智能体要驱动浏览器或桌面应用走几十步、中途跑偏代价很高时,就用它。
速度
比5.4慢,比5.4 Mini慢得更明显。据Artificial Analysis,中等推理强度下约70token/秒。把它留给真正需要额外推理深度的步骤,其余的用更轻的档位并行跑。
幻觉表现
GPT-5.5延续了GPT-5一代更严格的校准,倾向于承认不确定,而不是硬编一个答案。这也是为什么即便DeepSeek V4 Pro这类更便宜的选择已经在基准上追平,生产团队在高风险推理上仍愿意为它多付钱。
GPT-5.5最适合的智能体任务
跑多工具计划的编排者
把GPT-5.5当作规划者:把客户的一个请求拆成十个步骤,每一步派给GPT-5.4或5.4 Mini档的子智能体,再把结果拼回来。只在规划这一层跑5.5、其余都用更便宜的档位,花费只是全程跑5.5的一个零头,质量却大部分都保住了。
一次就改对、不白跑CI的代码改动
让GPT-5.5把一个50个文件的代码库从一个ORM迁到另一个、重构一个缠成一团的模块,或者在整个仓库里打上一个安全补丁。补丁第一次就干净应用的概率高于家族里任何其他模型,这一点会直接反映在你的CI账单上。
必须把流程跑完的计算机操作智能体
当智能体要驱动浏览器走完多步骤的预订流程、操作桌面应用或老旧的后台界面时,5.5更高的OSWorld分意味着更少的中途跑偏和更少的人工接管。只要有一次长会话不必重来,多付的钱就赚回来了。
难数学或难科学的研究环节
丢进一套竞赛级数学题,或者一段研究生水平的物理推导,5.5能一路做下来,不会出现5.4那种差一位的低级失误。AIME 2025和GPQA Diamond衡量的正是这类表现。
什么时候不该用GPT-5.5
以下场景别用GPT-5.5:大量常规工作——GPT-5.4用一半的积分成本就能达到同样的质量线;对延迟敏感的对话回复——GPT-5.4 Mini快得多;大批量分类或抽取任务——GPT-5.4 Mini是更便宜的批量选项。
GPT-5.5与其他模型对比
GPT-5.5对比GPT-5.4
GPT-5.4是GPT-5家族里的主力默认,也是大多数智能体该选的那个。只有当5.4在难推理、长智能体循环或一次改对代码上明显失手时,才升级到GPT-5.5,通常是让它做编排者,往下把任务派给5.4或5.4 Mini档的子智能体。
GPT-5.5对比Claude Opus 4.7
不同家族里的同一个角色:高风险场景的编排者,也是便宜档位失手时你会升级去用的那个。Opus 4.7有100万token上下文窗口和Anthropic的安全特性;GPT-5.5的计算机操作分数更高,对已经在用Codex框架的团队来说是顺手的选择。按你现有智能体面向哪个框架和生态来选。
GPT-5.5对比Gemini 3 Pro
Gemini 3 Pro在纯长上下文推理(200万token窗口)和部分多模态基准上领先。GPT-5.5则在智能体编程(SWE-bench Verified、Terminal-Bench)和计算机操作上领先。智能体要改代码或驱动界面就选GPT-5.5;工作量主要是大量文档或视频理解就选Gemini 3 Pro。
结论:你该用GPT-5.5吗?
在OpenAI这一侧,GPT-5.5是升级档。默认用GPT-5.4;只在5.4明显失手的那些具体步骤上才升到5.5。
常见问题
GPT-5.5的上下文窗口有多大?
40万token,每次回复最多输出12.8万token。整个窗口都按标准价格计费。
GPT-5.5能处理图片吗?
可以。GPT-5.5是多模态模型,除了文本和代码,也接受图片输入,因此基于截图和文档识别的智能体可以原生工作。要生成图片,请用OpenAI的Images API。
什么时候该选GPT-5.5而不是GPT-5.4?
三种情况:(a)智能体本身是规划者/编排者,决策会层层传导;(b)运行足够长,5.4开始把工具调用走错;(c)输出必须第一次就干净可用(代码改动、结构化数据、计算机操作工作流)。
GPT-5.5支持提示词缓存吗?
支持。缓存输入每100万token计费$0.50——缓存那部分相当于打一折。只要系统提示词或工具结构在多次调用之间保持稳定,就值得用。
GPT-5.5在Okou上走哪个框架?
Codex。Okou通过Codex框架的Responses API接口调用GPT-5.5,这也是codex CLI默认使用的接口。在Okou上,Claude Code框架的智能体不兼容GPT-5系列模型。
替代选择
在Okou上使用GPT-5.5
在Okou上使用GPT-5.5的两种方式
Okou既支持把GPT-5.5作为Built-in模型使用、按Okou积分计费,也支持你用OpenAI API key自带密钥接入。Built-in这条路走的是Okou Managed路由和下文说明的价格档;自带密钥这条路由上游服务商直接向你收费,完全跳过Okou的积分换算。
Okou的建议
Okou把GPT-5.5定位为核心智能体模型,用于编排、涉及代码的工作,以及其他一旦答错代价很高的环节。
积分与$$$价格档
Okou给每个Built-in模型都定了四档积分价格——$、$$、$$$、$$$$——它会作为标记出现在模型选择器里,也出现在zero model ls的price tier那一行。GPT-5.5属于$$$。这一档决定你从Okou积分余额里扣掉多少;上表里的服务商标价,则是上游服务商在Okou把它换算成积分之前收取的费用。
自April 2026起在Okou上可用。

