hero

OpenAI 出了一篇看起來像中立的 AI 投資指南,標題叫「如何在 agent 時代管理 AI 投資」,內文列出五個「自信投資的方法」。但讀完你會發現,每個建議的終點站都是「買更多 OpenAI 產品」。這篇文章值得翻譯,不是因為它的建議多有啟發性——而是因為它完美示範了當一家 AI 公司同時當賣家和裁判時,ROI 的定義權在誰手上。

原文摘要

OpenAI 的目標是讓 AI 隨著時間變得更易取得、更強大、更便宜。從 GPT-4 到 GPT-5.4,每百萬 token 的價格下降了 97%。GPT-5.6 延續這個趨勢,在 Artificial Analysis Coding Agent Index 中交出更好的表現,輸出 token 減少 54%,每項任務耗時減少 57%。

但 token 單價本身無法說明 AI 是否正在創造價值。領導者應該關注的是「每塊錢能完成的有用工作」(useful work per dollar):完成了多少任務、節省了多少時間、改善了哪些決策、哪些工作流已經準備好規模化。

隨著團隊從單次對話走向長時間運行的 agent 工作流,管理員需要更清晰的視野來掌握需求、支出與風險。

以下是五個自信投資的方法。

1. 提高使用量與支出的可見度

企業領導者需要一個「AI 使用的清晰視野」:誰在使用、用哪些產品或模型、消耗了多少容量、這些使用支撐了什麼類型的工作。沒有這種可見度,一張持續膨脹的帳單很難解讀——它可能反映浪費,也可能是生產性的實驗,或者是一條正在變成業務關鍵的工作流。

ChatGPT Work 支援更長、多步驟的任務,因此使用量會因工作流不同而有很大差異。管理員需要看到使用量背後的工作內容,而不只是消耗了多少額度。透過 Admin Console 中更新的使用分析與支出控制功能,管理員可以看到採用率、額度使用量、按使用者/產品/模型分類的支出、隨時間變化的趨勢、新興的使用模式,以及判斷使用量何時反映的是廣泛採用、重度使用者的工作流、還是值得更多投資的重複性業務流程。

不同層級的分析視角有助於引導投資與資源配置決策:

  • 工作區層級:採用率和支出是否同步成長?
  • 團隊與使用者層級:需求在哪裡成長?誰可能需要更多支援?
  • 產品與模型層級:更昂貴的智慧被用在哪些地方?這種需求是持續的嗎?

綜合這些視角,管理員可以決定在哪裡投資、在哪裡進行引導、在哪裡設定限制。

2. 用成果 ROI 評估模型效率

最低的 token 單價不一定帶來最低的總成本。一個便宜的模型可能會失敗、重試,或產出需要修正的結果。一個更強大的模型可能每 token 更貴,但能更快達到可接受的結果,嘗試次數更少、審查成本更低。

評估模型應該根據它們需要完成的工作。使用能反映真實任務的 eval——包含邊界案例——並在測試前定義什麼叫「夠好」。然後衡量達到那個標準的完整成本:模型與工具使用量、嘗試次數、完成率、延遲、人工審查成本。

對優先工作流而言,應追蹤「每個被接受的成果的成本」(cost per accepted outcome)。在客服場景中,那可能是一個已解決的案件;在工程場景中,可能是一個通過審查的已測試變更。將這個成本與商業價值配對——節省的時間、縮短的週期、保護的營收、避免的風險、創造的產能。

模型選擇只是方程式的一部分。清晰的指令、聚焦的工具、可重複使用的上下文、明確的停止條件,都可以減少迴圈和浪費的支出。目標是將模型和工作流與任務匹配:在能達到品質標準時使用更小或更快的模型,把前沿智慧保留給複雜、模糊或高風險的工作。

3. 在規模化之前治理進階工作流

企業領導者應將治理視為決定哪些 AI 工作可以規模化的作業層。實務上要做的是:定義 ChatGPT 可以使用哪些上下文、可以存取哪些工具、可以執行哪些動作、誰來批准高風險步驟、以及當團隊找到有價值的工作流時如何授予額外容量。

當團隊開始採用 plugins、connectors、Computer Use 以及其他可以在企業系統之間操作的前沿能力時,這一點變得更加重要。ChatGPT Work 為管理員提供集中化的控制項,涵蓋存取權限、核准的上下文、連接的工具、允許的動作、使用量與支出。支出控制項——如工作區預設值、群組上限、個人例外、附帶專案背景的審查請求——幫助領導者支援高價值工作,而不需要全面調高限制。

對於優先部署,OpenAI 的 AI Deployment Engineers 可以直接與客戶合作,在 eval、架構、延遲、可靠性、工作流設計等方面進行優化,以同時提升效能和成本效率。隱私與治理應該從一開始就納入這項工作:敏感的工作流在規模化之前,需要正確的存取控制、資料保留策略、合規可見性與審批路徑。在適用的場景中,OpenAI 的企業隱私控制——包含 Zero Data Retention 選項——可以幫助客戶在高信任環境中部署 AI。

4. 資助能夠產生複利的工作流

企業領導者應該把 AI 投資當作一個投資組合來管理:為日常生產力提供廣泛的存取權、針對特定功能的工作流來改善重複性工作、以及少數圍繞公司專有上下文建立的策略性押注。最強的候選者是那些以有意義的規模重複發生、有明確的負責人、且可以在品質、風險和商業價值上被衡量的工作流。

資金應該跟隨成熟度走。探索階段應測試模型是否能處理該任務;驗證階段應以代表性案例對照明確的品質標準進行測試;生產階段的資金應支援規模化所需的整合、控制、可靠性與變革管理。共享能力——如身份驗證、受信任的連接器、策展知識庫、eval、可觀測性、模型路由、可重複使用的 agent 模式——應由中央資助,這樣每條新的工作流都能更容易、更安全地啟動。

5. 將容量與已證實的需求匹配

一旦一條工作流證明了它的價值,領導者應該讓產品、容量和支援模式與其需求匹配。ChatGPT Work 提供了即開即用的能力,涵蓋對話、編碼、agent 工作流、connectors、plugins、Computer Use 和行政管理。公司可以用專有資料、權限、eval 和工作流邏輯來擴展這個基礎——前提是這些元素能創造差異化價值。

對於生產工作負載,商業結構應該與使用模式匹配:Guaranteed Capacity 用於需要存取確定性的生產系統和 agent、Scale Tier 用於可預測的高量 API 工作負載、Batch API、Flex processing 或 Prompt Caching 用於非同步工作或重複上下文。

對於更大規模的策略部署,OpenAI Frontier and Deployment Company 可以幫助企業在企業系統之間建構、部署和管理 AI 同事。這個做法讓領導者可以用正確的產品、容量和支援模式來規模化已證實的工作,而不是讓每條工作流各自重建自己的基礎設施。

城武觀點

這是一篇銷售文,不是投資指南。

OpenAI 文章的框架是「五個自信投資 AI 的方法」,乍看像一份中立的企業顧問報告。但你把五個方法的建議終點攤開來看:

方法一叫你用 Admin Console 追蹤使用量——OpenAI 產品。 方法二叫你用 eval 衡量 ROI——OpenAI 的 eval 框架。 方法三叫你用 ChatGPT Work 做治理——OpenAI 產品。 方法四叫你建 agent 工作流——跑在 OpenAI 平台上。 方法五叫你買 Guaranteed Capacity、Scale Tier、Frontier——全都是 OpenAI 的付費方案。

整篇文章的形狀是:你有一個問題 → 你需要更多可見度 → 你需要更多控制 → 你需要更多容量 → 你需要更多 OpenAI 產品。這不是投資建議的邏輯鏈,這是銷售漏斗。

更關鍵的是那句話:「關注每塊錢能完成的有用工作(useful work per dollar)。」聽起來非常理性,像是一個可以被客觀衡量的指標。但「useful work」的度量標準由誰來定義?OpenAI 自己在方法二裡告訴你了:用 eval 來衡量。那 eval 是誰設計的?OpenAI。當賣家同時是裁判,所有 ROI 計算都建立在賣家自己的定義上。你以為你在衡量投資回報,其實你在用 OpenAI 給你的尺,量 OpenAI 賣給你的產品。

97% 降價是真的,但總帳單未必。

「token 單價從 GPT-4 到 GPT-5.4 降了 97%」是事實,我不否認。但這篇文沒告訴你的是:GPT-4 時代的 context window 是 8K token,到了 GPT-5.6 時代以經膨脹到數百 K。你現在跑一個 agent 工作流,上下文裡塞了整份程式碼庫、十輪對話歷史、五個工具定義、三份文件摘要——總 token 消耗量級跟 GPT-4 時代完全不是同一回事。降價 97% 的同時,單次工作流的 token 用量可能膨脹了 100 倍。

而且文章的整套建議方向就是「把更多工作流搬上來」——從單次對話擴展到長時間 agent、從少數使用者到全組織部署、從簡單任務到複雜的多步驟工作流。降價是為了讓你放心用更多。單位降價、總帳單不變——這是電信業和 SaaS 玩了二十年的經典商業模式,OpenAI 只是換了一層 AI 的皮。

這篇文章真正的標題應該是:「五個理由告訴你為什麼應該繼續加碼 OpenAI 生態系」,而它是一份剛好被公開的內部銷售備忘錄。

城武的未解檔案——當你的投資顧問同時是你的供應商,「每塊錢能做多少有用工作」的正確答案永遠只有一個:再多買一點。