Back to all posts

GPT-5.6 現已內建於 Zero

GPT-5.6 現已內建於 Zero

GPT-5.6 現已以三模型系列的形式內建於 Zero:Sol 適用於最艱難的多代理任務,Terra 適用於均衡的日常執行,Luna 則適用於快速、高吞吐量的工作流程。

對於需要路由多樣代理工作負載的團隊而言,這往往比單一新旗艦模型更實用。你不必在每個步驟都付出最高推理成本,而是可以根據任務選擇合適的模型,同時保留相同的 Zero 環境:連接的工具、檔案、瀏覽器存取、隔離執行、技能與後續跟進。

選擇內建路由,VM0 即可管理模型存取並以點數計費。如果你的團隊已使用 OpenAI API 金鑰或 ChatGPT/Codex 訂閱,Zero 同樣支援這些路由方式。

同一系列,三個運作點

OpenAI 以持久的能力層級為核心設計了 GPT-5.6。數字代表世代;Sol、Terra 與 Luna 則描述智能、速度與成本之間的取捨。

GPT-5.6 Sol:最艱難的任務

Sol 是旗艦模型。當任務夠困難,且更強的規劃、更多的驗證或平行作業能實質改變結果時,就應選用它。

Zero 的 GPT-5.6 Sol 整合預設使用 Ultra 推理模式。OpenAI 描述 Ultra 為協調四個代理平行運作,再整合其成果。這使 Sol 非常適合具有多個獨立工作流的任務,例如:

  • 遷移大型程式碼庫,同時測試相容性並記錄結果。
  • 跨多個來源進行市場研究、挑戰研究發現,並產出可供決策的簡報。
  • 將產品需求文件轉化為精緻的介面,檢查渲染結果,並修正視覺或功能問題。
  • 在日誌、程式碼、工單與瀏覽器狀態中調查生產事故,再提出修復方案。

Sol 對應 VM0 內建層級的 $$$。請在出錯代價高昂的場合使用它,而非用於每一個簡短回覆。

GPT-5.6 Terra:均衡的主力

Terra 是可重複執行的專業工作最合理的起點。OpenAI 將其定位為均衡層級,並表示其效能與 GPT-5.5 相當,但 API Token 定價僅為一半。

Terra 適用於仍需推理與工具使用、但不需要 Sol 最大算力的工作:

  • 日常研究、競爭對手監控與多來源摘要。
  • 例行程式碼變更、Pull Request 分析與問題調查。
  • 起草報告、上市計畫、客戶簡報與營運文件。
  • 需要強大長上下文處理能力、但成本要求較適中的代理工作流程。

Terra 對應 VM0 內建層級的 $$。它並非被強制設為通用預設;它只是我們在許多通用工作流程中會優先測試的層級。

GPT-5.6 Luna:速度與吞吐量

Luna 是系列中速度最快、成本最低的成員。它專為吞吐量與回應時間比最大深度更重要的工作而設計。

適合 Luna 的工作負載包括:

  • 對大批工單、潛在客戶或訊息進行分類或路由。
  • 從格式一致的文件中提取結構化欄位。
  • 執行初步分類,再將模糊案例升級至 Terra 或 Sol。
  • 大量產出簡短摘要或進行資料轉換。

Luna 對應 VM0 內建層級的 $。它並非所有低成本任務的正確選擇:OpenAI 自家的長上下文評估顯示,在超大輸入的檢索任務上,Luna 與另外兩個較大層級之間存在顯著差距。請將深度、模糊的上下文路由至 Terra 或 Sol。

基準測試能說明什麼——又不能說明什麼

OpenAI 在整個系列中回報了亮眼的結果,但真正有用的資訊是取捨的形態,而非單一排行榜名次。

在評估命令列代理工作流程的 Terminal-Bench 2.1 上,OpenAI 回報 Sol Ultra 為 91.9%、Sol 為 88.8%、Terra 為 87.4%、Luna 為 84.7%。在 BrowseComp 上,回報分數分別為 Sol Ultra 92.2%、Sol 90.4%、Terra 87.5%、Luna 83.3%。

長上下文結果是更重要的路由訊號。在 OpenAI MRCR v2、8-needle、256K–512K 上,Sol 得分 91.5%、Terra 89.6%,而 Luna 僅得 41.3%。Luna 在短暫、重複的工作上仍可表現出色;只是不應將其視為適用於所有工作負載的小型 Sol。

這些是廠商自行回報的評估結果,並非通用排名。基準測試衡量的是特定的測試框架、工具、推理設定與預算。你自己的工作流程可能會顛覆這個順序,因此在變更生產代理之前,請先重新執行一個具代表性的任務。

GPT-5.6 vs GPT-5.5 與 Claude Fable 5

實際的比較問題不是「哪個模型最強?」,而是「在這個執行階段,哪種行為值得付費?」

模型在 Zero 中的最佳用途突出之處VM0 內建層級
GPT-5.6 Sol規劃、平行執行、設計判斷或驗證能改變結果的艱難多階段工作Zero 預設使用 Ultra;在程式碼、電腦使用、設計、研究與深度上下文方面是最強的 GPT-5.6 層級$$$
GPT-5.6 Terra仍需可靠推理與工具的日常專業工作流程品質、速度與成本均衡;在長上下文工作中是系列內的強力選擇$$
GPT-5.6 Luna輸入一致且易於升級的快速、高吞吐量工作系列中延遲最低、成本最低;適合分類、提取與批次處理$
GPT-5.5已驗證且尚不需要重新建立基準的現有 OpenAI 工作流程熟悉的前沿行為,以及現有代理的穩定比較基準可用性取決於工作區設定
Claude Fable 5最深度的 Anthropic 與 Claude Code 工作流程,尤其適合已針對其行為進行調校的團隊頂級的長期推理能力,以及獨特的供應商/工具生態$$$$

OpenAI 回報 Sol 在 Agents' Last Exam 與 Artificial Analysis Coding Agent Index 上領先 Fable 5,而 Fable 5 在 GDPval-AA v2 上仍略勝一籌。這正是「最佳模型」這個說法過於籠統的原因。當你需要 OpenAI 最強的代理程式碼、電腦使用、設計與多代理行為時,Sol 極具吸引力。對於頂級的 Anthropic 工作以及已針對 Claude Code 進行校準的工作流程,Fable 仍是有效的選擇。

Terra 是許多 GPT-5.5 工作負載更直接的升級候選:OpenAI 表示其效能與 GPT-5.5 相當,但 API Token 定價僅為一半。Luna 的優化目標不同——速度與規模——因此應以每美元或每分鐘完成的工作量來比較,而非僅看峰值基準分數。

「內建」在 Zero 中代表什麼

內建讓 GPT-5.6 成為路由選擇,而非憑證設定專案。選擇 VM0 Managed 供應商,Zero 即可處理存取並按對應的 VM0 點數層級計費。你不需要為該路由建立或維護獨立的 OpenAI API 金鑰。

偏好使用自有供應商關係的團隊,仍可使用 OpenAI API 金鑰或連接 ChatGPT/Codex 訂閱。模型名稱保持不變;計費路徑與供應商設定則會改變。VM0 點數層級($$$$$$)與 OpenAI 公開 API Token 價格並不相同。

如何在 Zero 中啟用 GPT-5.6

GPT-5.6 是在模型設定中選擇的,而非在提示詞中輸入「使用 GPT-5.6」。

  1. 開啟設定,從側邊欄選擇模型
  2. 個人區塊中,新增 GPT 5.6 SolGPT 5.6 TerraGPT 5.6 Luna
  3. 選擇內建以使用 VM0 Managed 路由,或選擇你已連接的 OpenAI API 或 ChatGPT/Codex 供應商。
  4. 開始對話或執行,打開模型選擇器,切換至你想要的層級。
  5. 一旦工作流程穩定,在代理或技能層級設定適當的模型,讓例行工作始終使用預定的路由。

實用路由策略手冊

從三個問題開始:

  1. 錯誤答案的代價有多高? 當錯誤會造成大量返工、風險或下游影響時,使用 Sol。
  2. 上下文有多深、多模糊? 對於需要交叉驗證與整合的大型、雜亂輸入,使用 Terra 或 Sol。
  3. 這個任務會執行多頻繁? 對高吞吐量、可預測的工作使用 Luna,再對例外情況進行升級。

混合路由模式值得測試:Luna 過濾並結構化輸入,Terra 完成主要工作,Sol 處理少數值得最大推理的決策。你不需要一個模型做所有事;你需要的是每個階段使用足夠的模型。

GPT-5.6 讓這個選擇變得異常清晰。Sol、Terra 與 Luna 在相同的代理環境中為 Zero 提供了三個運作點——讓你在工作需要時提升能力,在不需要時降低成本。

資料來源

Stay in the loop

// Get the latest insights on AI teammates and collaboration.