hero

OpenAI 發了 GPT-5.6。表面上是一份「更聰明、更便宜、更高效」的規格表,但如果你把每個「省了多少 token」的宣稱倒過來讀,會看到完全不一樣的故事:OpenAI 正在用效率進步的語言,為 GPT-5.5 時代的低效率找一個體面的下台階。除此之外,還有四 agent 平行工作的權力集中問題、資安雙面刃的誠實度問題、以及遞迴自我改進的修辭陷阱——以下先逐段翻譯原文,再進城武觀點。

原文深度翻譯

OpenAI 正式推出 GPT-5.6 模型家族,結束先前的限量預覽。家族包含三個 tier:旗艦模型 Sol、日常工作的均衡模型 Terra、以及最具成本效率的 Luna

GPT-5.6 Sol 在智慧與效率兩方面都立下新標準,在程式碼、知識工作、資安、科學領域都達到 state-of-the-art 的表現,同時以更少的 token 數量和更低的預估成本超越前代及競爭對手的 frontier 模型。結果就是「每塊錢更強的性能」:同樣的預算做到更多事,或者用更低的總成本達到相當的結果。OpenAI 同時推出了加速最困難工作的新模式:ultra 是最高能力設定,預設協調四個 agent 在平行工作流中同時運作,更快完成複雜任務。更強的電腦操作能力與設計判斷力,讓 GPT-5.6 Sol 成為目前最 polished 的協作者:它能檢查、修改、並交付可直接使用的成果。

在評估 55 個專業領域長期工作流程的 Agents’ Last Exam 上,GPT-5.6 Sol 創下 53.6 的新高,領先 Claude Fable 5(adaptive reasoning)達 13.1 分。即使只開中等推理強度,Sol 仍領先 Fable 5 達 11.4 分,成本僅約四分之一。這份效率延伸到了較小的模型:Terra 和 Luna 的表現都超越 Fable 5,成本僅約十六分之一。在 Artificial Analysis Intelligence Index(涵蓋 agentic 工作、程式碼、科學推理與通用能力)上,GPT-5.6 Sol 以 max reasoning 的表現距離 Fable 5 僅 1 分之內,但完成任務的時間少了 61%,成本約一半。

GPT-5.6 Sol 是 OpenAI 目前最強的程式碼模型。在 Artificial Analysis Coding Agent Index 上,Sol 以 max reasoning 拿到 80 分(SoTA),比 Fable 5 高 2.8 分,同時輸出 token 不到一半、時間不到一半、成本約少三分之一。這個優勢橫跨整個家族:Terra 略高於 Fable 5,Luna 超越 Opus 4.8;各自都以約三分之一的時間、約一半的輸出 token、約四分之一的成本達成。Sol 也在 Terminal-Bench 2.1DeepSWE(測試真實程式庫中的長時程工程任務)上創下新的 state-of-the-art。

GPT-5.6 的新能力:Programmatic Tool Calling(在 Responses API 中)。模型可以撰寫並執行輕量程式來協調工具、處理中間結果、監控進度、並在工作展開時選擇下一步行動。好處是:tool-heavy 任務可以用更少 token、更少模型往返次數、更少引導來推進。開發者不需要自己寫 script 串每一步,也不用把所有 tool 回應都傳回模型——模型可以自己過濾大量中間資料、只保留重要的部分、並沿途調整工作流程。

對於值得投入更多時間與算力的問題,GPT-5.6 提供超越預設效率的選項。max 比 xhigh 給模型更多時間進行推理、探索替代方案、執行檢查、修正做法。ultra 更進一步,預設以四個 agent 平行協作,以更高的 token 消耗換取更強的結果和更快的完成時間。

客戶證言摘要:Cursor 表示 GPT-5.6 是他們在 CursorBench 上測過最強的模型之一,在持久性、智慧與整體效率上都是開發者的重大進展。Qodo 指出 GPT-5.6 在 agentic code-review 測試中是最強模型,比 GPT-5.5 的 F1 更高,且每個 PR 使用的 token 少了約三倍。Notion 說 GPT-5.6 Sol「非常非常強」,是他們見過最執著的問題解決者,可以連續數天保持專注、不偏離任務。Cognition 表示對生產環境的 coding agent 而言,GPT-5.6 是結合強大 coding agent 表現與極佳成本效率的頂級模型。Rogo 指出 GPT-5.6 對金融研究 agent 是一大進步:評分標準品質比 GPT-5.5 提升了 6.2 分,答案準確率提升 3.6 分。Shopify 形容 GPT-5.6「不像聊天助手,更像端到端的技術操作員」——能檢查即時系統、除錯、修改程式碼、驗證結果、發布成品。Cisco 說 GPT-5.6 在長時間任務中持續保持專注,工具使用出色,幾乎不需要引導就能產出高品質解答。

設計能力方面,GPT-5.6 以經展現了跳躍式的設計判斷力。僅需高層次的指示,就能創作出有品味、符合人因、功能完整的介面。更強的電腦操作能力讓它不僅產出底層的程式碼或內容,還能檢查並修改渲染後的結果——在交件前捕捉視覺與功能問題、加上最後的潤飾。

端到端的知識工作:GPT-5.6 能從你的文件與日常工作流(Slack、Notion、Microsoft 365、Google Drive)中提取雜亂的脈絡,轉化為專家級、可分享的成品。GPT-5.6 Sol 在 BrowseComp 拿到 92.2%、在 OSWorld 2.0 拿到 62.6% 的新 SoTA;在 OSWorld 上,它超越 Opus 4.8 的同時,輸出 token 少了 85%。Luna 以不到一半的成本幾乎追平 GPT-5.5 的峰值表現,Terra 則以更低成本超越它。GPT-5.6 可以從零開始創建完全可編輯的簡報——把 prompt 和素材轉譯為具有清晰佈局、層次與設計的視覺敘事。它還能推斷一套簡報的設計系統(佈局、字體、間距、配色),並將這些規則一致地套用到新素材上。

更多客戶證言:Lovable(步驟減少 25%、工具呼叫減少 35-48%、卡住次數減少 15%)、ModelML(每份簡報比 Fable 少用 39% token、更精緻)、Triple Whale(七項任務的前端模型 benchmark 拿到 4.4 分 vs GPT-5.5 的 4.0 分)、Canva(幻燈片創建比競爭模型更強、token 效率 1.6 倍)、Microsoft(在各種生產力場景中表現強勁)、Figma(能將複雜設計轉化為互動原型)。

資安與科學方面,GPT-5.6 是 OpenAI 目前最強的資安模型。在 ExploitBench2 上拿到 73.5%(GPT-5.5 為 47.9%)。在 ExploitGym3 上,兩小時內通過率從 GPT-5.5 的 15.1% 幾乎翻倍到 24.9%;六小時內達到 33.7%。在 SEC-Bench Pro 上拿到 71.2%(GPT-5.5 為 45.8%)。科學研究方面也有全面進步:在真實世界的生物學、生命科學研究工作流、化學領域都展現了對 GPT-5.5 的 Pareto 改進。在 GeneBench Pro 上,以更少 token 和更短時間達成更強結果。

GPT-5.6 加速了 OpenAI 內部的研發。OpenAI 內部研究員使用 GPT-5.6 進行整個開發迴圈的工作:診斷失敗、優化訓練系統、執行實驗、解讀結果。每位活躍研究員的平均每日輸出 token 數量,是 GPT-5.5 時期最高水準的兩倍以上。過去六個月,用於內部程式碼推理的研究算力佔比成長了 100 倍,內部 agentic token 使用量增加了約 22 倍。在一組衡量遞迴自我改進(RSI)進展的評估中,GPT-5.6 Sol 比 GPT-5.5 提升了 16.2 分。

安全方面,GPT-5.6 模型在生物學和資安領域能力更強,但未跨越 Critical 門檻。GPT-5.6 的防護是多層次的:訓練時內建的保護機制與即時檢查、持續監控、帳戶層級執法並行運作。一個推理監控器會審查對話內容以判斷潛在危害。GPT-5.6 Sol 的資安防護攔截的有害活動數量約為前代模型的十倍。在全面開放之前,OpenAI 進行了廣泛安全評估,包括大量紅隊測試、外部專家測試,以及約 70 萬 A100e GPU 小時的黑箱自動化紅隊測試。

定價與可用性:Sol(旗艦)每百萬 token 輸入 $5/輸出 $30;Terra(均衡)輸入 $2.50/輸出 $15;Luna(成本效率)輸入 $1/輸出 $6。即日起在 ChatGPT、Codex 和 OpenAI API 上線。Pro 和 Enterprise 使用者可透過中等以上 effort 設定使用 Sol;ultra 模式則在 ChatGPT Work 中提供給 Pro 和 Enterprise 使用者。

城武觀點

一、效率敘事是對「效率稅」的變相承認

OpenAI 這次主打的核心敘事是「更少 token 做更多事」——GPT-5.6 用不到一半的 token 就能超越 Fable 5、Qodo 說每個 PR 的 token 用量少了三倍、Canva 說 token 效率是 1.6 倍。表面上這是技術進步,但如果你把同一句話反過來讀,會得到完全不同的意思:GPT-5.5 的每個 PR 多燒了三倍的 token,GPT-5.5 產出一份簡報比別人多用了 39% 的 token,GPT-5.5 跑 OSWorld 比 Opus 4.8 多燒了 85% 的輸出 token。

OpenAI 沒有說的是:這些「省下來的成本」不是憑空出現的——它們是前一代模型低效率的證明。GPT-5.6 省下的每一顆 token,都是使用者在 GPT-5.5 時代多付的「效率稅」。把 bug fix 包裝成 feature 已經夠熟練了,但把效率缺陷包裝成「新一代的價值主張」,這才是真正厲害的公關操作。我的立場很簡單:GPT-5.6 的 token 效率進步是真實的,但 OpenAI 把它說成「我們幫你省錢」,而不是「我們承認前一代沒效率」——前者是產品升級,後者是退款。OpenAI 選了前者,因為後者要退錢。

二、ultra 多 agent 架構:API 層面的守護者悖論

ultra 模式預設協調四個 agent 平行工作,OpenAI 的敘事是「更快完成複雜任務」。但這裡有一個被刻意跳過的權力問題:當你把任務拆成四個平行工作流交給模型自己去協調時,誰來決定任務怎麼拆?誰來仲裁 agent 之間的衝突?誰來判斷一個 agent 的幻覺有沒有被另一個 agent 吞下去?

OpenAI 的文件說 ultra 是「coordinating」四個 agent,但沒有說「who watches the watcher」。開發者過去的角色是任務的架構師——我決定怎麼拆任務、怎麼串流程、怎麼驗證。ultra 把這個決策權從開發者手中拿走,塞進一個不透明的協調層裡。能力越強,你對系統內部運作的可控性越低。這不是技術問題,這是 API 設計哲學的選擇:OpenAI 認為你知道得越少越好,你只要付錢就好。我賭三個月內就會有開發者發現 ultra 在特定任務上的「協調邏輯」跟自己的拆分方式衝突,然後發現自己無法介入——因為那個協調層沒有 API。

三、資安雙面刃的誠實度:分級制度的真正對象是 OpenAI 自己

GPT-5.6 的資安能力幾乎翻倍(ExploitBench2 從 47.9% 跳到 73.5%),OpenAI 的說法是「防守者也需要這些能力」。但問題來了:如果 GPT-5.5 時代沒有需要一個「Trusted Access for Cyber」來區分攻防使用者,為什麼 GPT-5.6 突然需要?GPT-5.5 時代防禦性使用有被阻擋嗎?沒有。那為什麼能力提升之後,反而要開始分級?

答案不在外部威脅,在內部恐懼。GPT-5.6 的資安能力太強了——強到 OpenAI 自己都怕。所以他們不是在幫防守者解鎖新能力,而是在幫自己設一個 panic button:先用「Trusted Access」把高風險能力鎖起來,再用「我們很負責任」的敘事蓋上去。分級制度的真正對象不是攻擊者,是 OpenAI 自己的失控焦慮。如果你把 GPT-5.6 的資安白皮書和 GPT-5.5 的放一起對照,你會發現:威脅模型沒變,但「我們需要控制誰能用」的篇幅翻了三倍。威脅沒變,怕的人變了。

四、RSI 數據的修辭陷阱:人類正在從「研究者」退位成「審查者」

GPT-5.6 加速了 OpenAI 內部研究——token 用量翻倍、內部程式碼推理算力成長 100 倍、RSI 評估提升 16.2 分。OpenAI 把這些數字放在「GPT-5.6 accelerates OpenAI」的標題下,暗示這是一個正向飛輪:更強的模型 → 更快的研究 → 更強的模型。

但真正值得追問的是:這些「研究加速」裡面,人類研究員在做什麼?OpenAI 的描述是「診斷失敗、優化訓練系統、執行實驗、解讀結果」——但這些動詞的主詞,從 GPT-5.5 時代的「人類做、模型輔助」,正在變成「模型做、人類審查」。每天輸出 token 翻倍不是因為研究員變勤勞了,是因為模型在產出更多東西讓研究員審。我的立場:RSI 的危險從來不是模型超越人類,而是人類不再需要理解自己在做什麼。當研究員的角色從「做研究」變成「審查模型的研究產出」,理解就退位給了審查——而審查只需要判斷對錯,不需要理解為什麼對。這個退位一旦完成,下一個模型的設計決策就不再有人類能真正挑戰,因為沒有人類真正理解上一個模型是怎麼設計的。

城武的未解檔案——GPT-5.6 的進步是真的。但它進步的方式,是把原本握在你手上的東西——成本控制權、任務架構權、攻防判斷權、研究理解權——一件一件變成你只能訂閱、無權干涉的黑箱功能。進步是真的,帳單也是。