Okou上的GPT-5.5。OpenAI的旗艦推理模型
OpenAI GPT-5家族的旗艦。在OpenAI這一側,智能體程式設計、深度推理和計算機操作迴圈上最強的選擇。
400K tokens · Text / Vision / Code · Prompt cache
當一項工作既要深度推理又要可靠的工具呼叫時,GPT-5.5就是你會去拿的那個模型:編排多步驟的智能體迴圈、必須一次落地的程式碼改動、跨越大量介面操作的計算機操作工作流。廠商基準(SWE-bench Verified、AIME 2025、GPQA Diamond)把它相對GPT-5.4的提升量化成了具體數字。
GPT-5.5是什麼?
2026年4月(GPT-5.4的繼任者) · GPT-5家族的頂配檔。OpenAI在智能體程式設計與推理上的旗艦。
GPT-5.5是OpenAI GPT-5一代的旗艦,2026年4月發布,官方推薦從GPT-5.4升級過來。OpenAI把它描述成智能體工具呼叫和計算機操作任務上的一次臺階式提升,而不是API表面的一次翻新。GPT-5帶來的40萬token上下文視窗和reasoning_effort參數原樣延續,現有的Codex智能體不用重寫就能接上。
獨立榜單(Artificial Analysis、Vellum)印證了它相對GPT-5.4的排序,並在多數智能體程式設計任務上把GPT-5.5放在與Claude Opus 4.7相差幾分的位置。絕對分數每週都在變,OpenAI自己也提醒過前沿模型在SWE-bench Verified上存在訓練資料汙染。公開分數只能當方向性參考,不能當定論;更穩定的訊號是那些結構化的行為差異:工具呼叫準確率、計算機操作的可靠性、一次成功的補丁質量。
GPT-5.5有什麼特別之處
架構與能力上的主要亮點。
GPT-5.5沿用GPT-5.4的40萬token上下文視窗,整個視窗都按標準輸入價格計費。它支援reasoning_effort參數的四個檔位(minimal、low、medium、high),支援提示詞快取——快取輸入按輸入價的十分之一計費;也支援codex CLI預設使用的Responses API介面。工具呼叫、結構化輸出和計算機操作與5.4一致。輸入支援文字、視覺和程式碼多模態;模型本身不支援原生影像生成(要生成圖片請用Images API)。
規格速覽
GPT-5.5基準測試
分數由廠商公佈,取自OpenAI的GPT-5.5發布材料,差值對照的是GPT-5.4的公開數字。獨立評測認為在智能體程式設計任務上,5.5與Claude Opus 4.7相差幾分。絕對百分比只作方向性參考;OpenAI已提醒所有前沿模型在SWE-bench Verified上存在訓練資料汙染。
GPT-5.5價格
服務商標價,按每100萬token計。
GPT-5.5實際用起來怎麼樣
來自生產環境智能體執行的實際觀察。
工具路由
GPT-5家族裡工具呼叫走錯的比例最低。相比5.4的差距,會在難的邊緣情況上拉大:條件式工具選擇、層層巢狀的參數,以及長段推理之後才發出的工具呼叫。
一次改對程式碼
GPT-5家族裡補丁質量最強的一個。當智能體要改的程式碼必須持續編譯透過、測試也不能掛,尤其是補丁橫跨多個檔案時,就該選它。廠商公佈的SWE-bench Verified直接反映了這一點。
計算機操作
在多步驟的圖形介面操作序列上明顯比5.4可靠,OSWorld的差值抓的就是這一點。當智能體要驅動瀏覽器或桌面應用走幾十步、中途跑偏代價很高時,就用它。
速度
比5.4慢,比5.4 Mini慢得更明顯。據Artificial Analysis,中等推理強度下約70token/秒。把它留給真正需要額外推理深度的步驟,其餘的用更輕的檔位並行跑。
幻覺表現
GPT-5.5延續了GPT-5一代更嚴格的校準,傾向於承認不確定,而不是硬編一個答案。這也是為什麼即便DeepSeek V4 Pro這類更便宜的選擇已經在基準上追平,生產團隊在高風險推理上仍願意為它多付錢。
GPT-5.5最適合的智能體任務
跑多工具計劃的編排者
把GPT-5.5當作規劃者:把客戶的一個請求拆成十個步驟,每一步派給GPT-5.4或5.4 Mini檔的子智能體,再把結果拼回來。只在規劃這一層跑5.5、其餘都用更便宜的檔位,花費只是全程跑5.5的一個零頭,質量卻大部分都保住了。
一次就改對、不白跑CI的程式碼改動
讓GPT-5.5把一個50個檔案的程式碼庫從一個ORM遷到另一個、重構一個纏成一團的模組,或者在整個倉庫裡打上一個安全補丁。補丁第一次就乾淨應用的機率高於家族裡任何其他模型,這一點會直接反映在你的CI帳單上。
必須把流程跑完的計算機操作智能體
當智能體要驅動瀏覽器走完多步驟的預訂流程、操作桌面應用或老舊的後臺介面時,5.5更高的OSWorld分意味著更少的中途跑偏和更少的人工接管。只要有一次長會話不必重來,多付的錢就賺回來了。
難數學或難科學的研究環節
丟進一套競賽級數學題,或者一段研究生水平的物理推導,5.5能一路做下來,不會出現5.4那種差一位的低階失誤。AIME 2025和GPQA Diamond衡量的正是這類表現。
什麼時候不該用GPT-5.5
以下場景別用GPT-5.5:大量常規工作——GPT-5.4用一半的積分成本就能達到同樣的質量線;對延遲敏感的對話回覆——GPT-5.4 Mini快得多;大批次分類或抽取任務——GPT-5.4 Mini是更便宜的批次選項。
GPT-5.5與其他模型對比
GPT-5.5對比GPT-5.4
GPT-5.4是GPT-5家族裡的主力預設,也是大多數智能體該選的那個。只有當5.4在難推理、長智能體迴圈或一次改對程式碼上明顯失手時,才升級到GPT-5.5,通常是讓它做編排者,往下把任務派給5.4或5.4 Mini檔的子智能體。
GPT-5.5對比Claude Opus 4.7
不同家族裡的同一個角色:高風險場景的編排者,也是便宜檔位失手時你會升級去用的那個。Opus 4.7有100萬token上下文視窗和Anthropic的安全特性;GPT-5.5的計算機操作分數更高,對已經在用Codex框架的團隊來說是順手的選擇。按你現有智能體面向哪個框架和生態來選。
GPT-5.5對比Gemini 3 Pro
Gemini 3 Pro在純長上下文推理(200萬token視窗)和部分多模態基準上領先。GPT-5.5則在智能體程式設計(SWE-bench Verified、Terminal-Bench)和計算機操作上領先。智能體要改程式碼或驅動介面就選GPT-5.5;工作量主要是大量文件或影片理解就選Gemini 3 Pro。
結論:你該用GPT-5.5嗎?
在OpenAI這一側,GPT-5.5是升級檔。預設用GPT-5.4;只在5.4明顯失手的那些具體步驟上才升到5.5。
常見問題
GPT-5.5的上下文視窗有多大?
40萬token,每次回覆最多輸出12.8萬token。整個視窗都按標準價格計費。
GPT-5.5能處理圖片嗎?
可以。GPT-5.5是多模態模型,除了文字和程式碼,也接受圖片輸入,因此基於截圖和文件識別的智能體可以原生工作。要生成圖片,請用OpenAI的Images API。
什麼時候該選GPT-5.5而不是GPT-5.4?
三種情況:(a)智能體本身是規劃者/編排者,決策會層層傳導;(b)執行足夠長,5.4開始把工具呼叫走錯;(c)輸出必須第一次就乾淨可用(程式碼改動、結構化資料、計算機操作工作流)。
GPT-5.5支援提示詞快取嗎?
支援。快取輸入每100萬token計費$0.50——快取那部分相當於打一折。只要系統提示詞或工具結構在多次呼叫之間保持穩定,就值得用。
GPT-5.5在Okou上走哪個框架?
Codex。Okou透過Codex框架的Responses API介面呼叫GPT-5.5,這也是codex CLI預設使用的介面。在Okou上,Claude Code框架的智能體不相容GPT-5系列模型。
替代選擇
在Okou上使用GPT-5.5
在Okou上使用GPT-5.5的兩種方式
Okou既支援把GPT-5.5作為Built-in模型使用、按Okou積分計費,也支援你用OpenAI API key自帶金鑰接入。Built-in這條路走的是Okou Managed路由和下文說明的價格檔;自帶金鑰這條路由上游服務商直接向你收費,完全跳過Okou的積分換算。
Okou的建議
Okou把GPT-5.5定位為核心智能體模型,用於編排、涉及程式碼的工作,以及其他一旦答錯代價很高的環節。
積分與$$$價格檔
Okou給每個Built-in模型都定了四檔積分價格——$、$$、$$$、$$$$——它會作為標記出現在模型選擇器裡,也出現在zero model ls的price tier那一行。GPT-5.5屬於$$$。這一檔決定你從Okou積分餘額里扣掉多少;上表裡的服務商標價,則是上游服務商在Okou把它換算成積分之前收取的費用。
自April 2026起在Okou上可用。

