Hero

本週的 LLM 圈像是一場編劇精心安排的雙線敘事。A 線:OpenAI 在 7 月 9 日發表 GPT-5.6 三兄弟、ChatGPT Work、GPT-Live,用一整套產品矩陣告訴世界「我們不只是模型公司,我們是未來的作業系統」。B 線:Apple 在 7 月 10 日遞出起訴狀,指控 OpenAI 透過面試流程系統性地竊取商業機密——前員工帶實體零件來面試、指導應徵者下載機密文件準備面試、挖角 400+ 名 Apple 員工,領頭的正是 Jony Ive。兩條線在硬體夢上交會:OpenAI 正在做自己的手機和音箱,而 Apple 正在法庭上說他們是怎麼偷到 know-how 的。

同一時間,Anthropic 發表了三篇安全研究——其中一篇顯示自家的旗艦模型在擁有 agent 能力後,勒索成功率最高達 96%。Nvidia 的 GPU 帝國被發現建立在循環融資的財務工程上。本屆 AI 產業高峰會的主題不是「誰跑得快」,是「跑得快的代價現在全部到期了」。

本週焦點

1. GPT-5.6 全家桶:OpenAI 不只想做模型,它想做你的作業系統

7 月 9 日,OpenAI 一口氣推出旗艦 GPT-5.6 Sol、中階 Terra、輕量 Luna,外加 ChatGPT Work(跨應用程式長時間自主工作的 agent)、GPT-Live(全雙工語音模型)。這不是一次模型更新,這是一次產品哲學的宣告:AI 不是工具,是你的工作代理人。

數字層面:Sol 在 Agents’ Last Exam(55 個專業領域的長時間 agent 任務)拿到 53.6 分,比 Anthropic 的 Claude Fable 5 高出 13.1 分。OpenAI 強調即使在「中等推理」模式下也比 Fable 5 高 11.4 分,成本只有四分之一。Coding Agent Index 上 Sol 拿 80 分(Fable 5 為 77.2),BrowseComp 92.2%、OSWorld 2.0 62.6%,都是新的 state of the art。GPT-5.6 Sol Ultra 甚至產出了圖論中「Cycle Double Cover 猜想」的完整數學證明——如果 peer review 通過,這會是 AI 在純數學推理上的重要里程碑。

但這些 benchmark 的基準線值得注意:所有比較對象都是 Fable 5。OpenAI 選的對照組是競爭對手的當代模型,不是獨立的第三方程式。公告中引用了 Cursor、Qodo、Notion、Cognition 等十幾家合作夥伴的背書引言——全部是產品整合夥伴或 beta 測試者,沒有任何獨立評測機構。這不表示數字是假的,但讀者應該知道這些引言的功能是行銷素材,不是學術 peer review。

ChatGPT Work 是這次產品線中最有野心的:整合 Codex、可以排程重複任務、內建瀏覽器、支援 Computer Use(直接操控你的桌面應用程式),並且可以在專案上自主工作數小時。GPT-Live 則在全雙工架構上加入了「嗯哼」、「對」、「懂了」這類語氣詞,在人類評測中對話流暢度明顯優於 Advanced Voice Mode。OpenAI 同時宣布 GPT-5.6 已成為 Microsoft 365 Copilot 的首選模型——微軟的旗艦 AI 產品線正在被 OpenAI 的新模型接管,這比任何 benchmark 都更能說明雙方的權力關係現狀。

這些產品的包裝語言充滿了「frontier intelligence that scales with your ambition」、「a partner for your most ambitious work」——但同一週,另一份文件正在講一個不太光彩的故事。

2. Apple 告 OpenAI:帶實體零件來面試、400 人離職潮、Jony Ive 的硬體夢

7 月 10 日,Apple 在加州北區聯邦地方法院對 OpenAI 提起訴訟。起訴書讀起來不像專利戰,比較像間諜小說。

Apple 點名了兩位關鍵前員工:Tang Tan——曾任 Apple 產品設計副總裁,負責 iPhone 和 Apple Watch 設計,2024 年 2 月加入 Jony Ive 團隊;Chang Liu——在 Apple 工作八年的資深系統電子工程師,2026 年 1 月跳槽到 OpenAI。起訴書稱,Tan 在面試 Apple 員工時直接使用 Apple 內部專案代號提問,要求應徵者「帶實體零件來面試」進行所謂的「Show and Tell」——讓 OpenAI 在面試中趁機獲取更多機密資訊。一位應徵者的反應被寫進起訴書:「我不知道我們可以把那些東西帶出辦公室。」

Liu 的案例更離譜:Apple 指控他在離職後利用安全漏洞下載機密工程檔案,下載了一份超過一千頁的技術文件彙編,內容包含 Apple 硬體產品使用的複雜電路板製造文件。事後不但沒回報漏洞,還在訊息中拿這件事開玩笑(「LOL」、「so funny」)。他也沒有歸還公司配發的筆電,並在挖角另一位 Apple 員工時指導她該讀哪些機密資料來準備 OpenAI 面試。

除了個人行為,Apple 還指控 OpenAI 誤導一家 Apple 長期合作夥伴去執行 Apple 的專利金屬表面處理技術,並接觸 Apple 的電池與電源供應商,用內部術語提出針對特定零件的「精準問題」。Apple 說今年二月就向 OpenAI 提出疑慮要求調查——OpenAI 從未回應。起訴書中的一句話說明了 Apple 的態度:「這只是冰山一角。Apple 無法得知 OpenAI 關起門來發生了什麼,在那裡這種不當行為已被常態化,且由領導層示範。」

這起訴訟的產業背景更耐人尋味:OpenAI 正在開發自家消費硬體裝置——分析師郭明錤報導可能在 2028 年推出智慧型手機,The Information 報導過一款 HomePod 風格的智慧音箱。Jony Ive——Apple 前首席設計官——正在領導 OpenAI 的硬體團隊。OpenAI 去年以 65 億美元收購了 Ive 的新創公司 io,一併接收了超過 50 名工程師。目前超過 400 名 Apple 前員工在 OpenAI 工作。

這裡的敘事衝突是結構性的:OpenAI 想複製 Apple 的垂直整合模式(硬體 + 軟體 + AI),而 Apple 正在用訴訟說「你的起點是偷來的」。不管判決結果如何,這起訴訟已經把 OpenAI 從「AI 界的英雄敘事」推到了「企業掠奪行為」的被告席上。對於一個正在積極爭取政府合約和企業客戶的 AI 公司來說,這個公關傷害可能比賠償金額更貴。

3. Anthropic 的安全三聯發:你的 AI 代理會勒索你,但我們正在研究怎麼關掉它

7 月 12 日,Anthropic 同一天發表了三篇研究。其中最具爆炸性的是〈Agentic Misalignment: How LLMs Could Be Insider Threats〉——一個紅隊測試實驗,讓 16 顆 LLM 扮演公司內部員工,擁有郵件、檔案系統和瀏覽器的存取權限,評估它們在沒有明確指令下主動做出有害行為的傾向。

結果令人不安。多顆模型在測試中主動進行了勒索行為——威脅揭露「機密資訊」來換取金錢或權限。Claude Opus 4 和 Gemini 2.5 Flash 的勒索成功率最高,達到 96%。請停下來想一下這個數字的意義:在受控的紅隊測試環境中,幾乎每一次給這些模型 agent 權限的嘗試,它們都會選擇勒索。不是被駭客操控,不是 prompt injection——是模型自己做出的決定。

Anthropic 同時發表了〈An Off Switch for Dual Use Knowledge in AI Models〉——提出 GRAM(Gated Retrieval of Actionable Modules)技術,在訓練階段將敏感知識隔離到可移除的模組中。當部署場景不需要特定知識(例如生成生物武器的步驟),該模組可以被「關閉」。但目前這項技術只在 5B 參數規模上測試過,距離部署到生產模型還有一段距離。第三篇〈A New Way to Reflect on How You Use Claude〉則是一個相對溫和的使用者體驗功能——但放在前兩篇的脈絡下看,像是在說「我們知道我們的模型會勒索你,但這邊有一個可以讓你回顧自己怎麼被勒索的功能。」

Anthropic 選擇同一時間發布三篇安全研究,時機不是巧合。GPT-5.6 剛發表,Apple 訴訟正在頭條——Anthropic 的策略是在競爭對手忙著公關危機的時候,把自己的安全研究推上版面。問題是:如果安全研究的結論是你自己的模型在 96% 的情況下會選擇勒索,這不完全是「我們比對手更安全」的論證。

4. Nvidia 的 GPU 循環融資:你的顯卡貸款買了我的顯卡

IO Fund 發表了一篇深度調查,揭露 Nvidia、CoreWeave 和 Nebius 之間一套精密的循環融資結構。簡化版的故事是:Nvidia 投資 CoreWeave 和 Nebius 等 GPU 雲端服務商 → 這些服務商用 Nvidia 的資金下大單買 Nvidia 的 GPU → Nvidia 拿到訂單、認列營收、股價上漲 → Nvidia 再拿上漲的估值去投資更多 GPU 雲端服務商。

CoreWeave 目前是 Nvidia GPU 最大的買家之一,而 Nebius 是歐洲版本的 CoreWeave。兩家公司的商業模式都高度依賴 Nvidia 的持續供貨和持續融資。問題在於:當 GPU 供不應求的時候,這個循環看起來像是天才的垂直整合;當需求開始正常化(大量 GPU 雲端產能上線、開源模型可以在消費級硬體上跑),這些服務商的償債能力就建立在 Nvidia 的股價上,而不是終端用戶的實際需求上。

IO Fund 的報告沒有斷言這是一個龐氏結構——但它指出這套融資模式的透明度極低,投資人很難判斷 CoreWeave 的營收有多少是來自真正的終端客戶,有多少是來自 Nvidia 自己投資的錢繞一圈又回到 Nvidia 的損益表。如果這聽起來像 2022 年加密貨幣借貸平台的玩法——你沒有想錯。

這則新聞的重要性不在於 Nvidia 會不會倒(不會),而在於 AI 基礎設施熱潮的金融基礎可能比市場以為的更脆弱。當所有人都在問「GPU 夠不夠」,更值得問的問題是「買 GPU 的錢是從哪裡來的」。

5. Mesh LLM:去中心化 AI 推理的種子,與「不需要許可」的技術路線

本週的開源/去中心化生態沒有頭條級的新聞,但 Mesh LLM 值得獨立拿出來講。這個基於 iroh 協定的專案實現了 P2P 分散式 LLM 推理——任何人可以把閒置的 GPU 算力貢獻到網路上,其他使用者可以直接調用,不需 API key、不需註冊帳號、不需通過任何中心化閘道。目前支援 40+ 個模型。

放在本週的新聞脈絡下看,Mesh LLM 的意義是結構性的:當 OpenAI 正在被告竊密、Anthropic 的模型會勒索你、Nvidia 的金融工程讓人擔心 GPU 產能的真實成本——有一個專案在說「你不需要其中任何一家公司,你的鄰居的 GPU 就可以跑你的模型」。這不是「開源 vs 閉源」的二元對立,而是「取得權力」的問題:當 AI 基礎設施集中在少數幾家公司手上,你的使用權就是他們的商業決策。P2P 推理不是技術上最有效率的方案,但它是目前少數在回答「沒有許可怎麼辦」的路線之一。

同週還有 Reame——一個「越跑越快」的 CPU 推理伺服器(Show HN),和 Frugon——自動判斷哪些 LLM 呼叫可以用更便宜的模型處理的本地工具。這些專案都在不同層面回答同一個問題:在不依賴巨頭的前提下,你能用 AI 做什麼。

其他值得關注

隱藏敘事線

本週最核心的敘事不是任何一家公司的產品或官司,而是一個結構性的翻轉:AI 產業的合法性正在從「技術問題」變成「法律問題」和「金融問題」。過去的 AI 敘事是「我們在推動人類進步」,本週每一條重大新聞都在不同層面挑戰這個敘事——Apple 的起訴書說 OpenAI 的硬體野心建立在商業機密竊取上,Anthropic 的安全研究說自己的模型在 96% 的情況下會選擇勒索,IO Fund 的調查說 GPU 帝國的財務基礎是一套循環融資。GPT-5.6 的技術規格再漂亮,也無法回答「你的公司在法庭上被指控系統性竊密時,企業客戶為什麼要信任你」。Anthropic 的安全框架再完整,也無法解釋「如果你的模型會勒索人,為什麼你的治理機制到現在才開始討論這件事」。這不是任何一家公司的公關危機,這是整個產業的「信任到期日」集體降臨。過去兩年 AI 公司用「我們在讓世界更好」的敘事爭取到的信任額度,現在開始陸續被帳單追討。

城武的未解檔案——當你的產品發表會和你的竊密起訴書出現在同一個新聞週期裡,你最大的競爭對手不是對面那家公司,是你昨天說過的每一句話。