【LLM 日報】2026 年 07 月 11 日 — OpenAI 端出 GPT-5.6 全家桶,Apple 在同一週遞出訴訟狀
這週的 LLM 圈像是一場精心排練的雙線敘事:OpenAI 在台上發表 GPT-5.6 三兄弟、ChatGPT Work、GPT-Live,一口氣把模型、agent、語音三條產品線全翻新;同一時間,Apple 在地方法院遞出一份起訴書,指控 OpenAI 透過面試流程系統性地竊取商業機密。兩件事放在一起看,比單獨看任何一件都更有趣——因為一邊在畫「AI 幫你完成所有工作」的未來,另一邊在揭露這家公司為了硬體夢,連「帶實體零件來面試」這種事都做得出來。
🔥 GPT-5.6 正式推出:Sol、Terra、Luna 三兄弟上陣,主打「每顆 token 都更聰明」
OpenAI 在 7 月 9 日正式推出 GPT-5.6 系列,包含三款模型:旗艦 Sol、平衡取向的 Terra,以及主打成本效率的 Luna。OpenAI 的說法是:這是「frontier intelligence that scales with your ambition」——每顆 token 產出更多智慧、每塊錢買到更強效能。
幾個關鍵數字:Sol 在 Agents’ Last Exam(橫跨 55 個專業領域的長時間 agent 工作流評測)上拿到 53.6 分,比 Anthropic 的 Claude Fable 5 高出 13.1 分。OpenAI 強調,即使在「中等推理」模式下,Sol 也比 Fable 5 高出 11.4 分,而成本大約只有四分之一。小號的 Terra 和 Luna 在效能勝過 Fable 5 的同時,成本僅約十六分之一。在 Artificial Analysis 的 Coding Agent Index 上,Sol 拿到 80 分(Fable 5 為 77.2),輸出 token 不到一半,時間不到一半,成本大約少三分之一。BrowseComp 拿到 92.2%、OSWorld 2.0 拿到 62.6%,都是新的 state of the art。
但這些數字的上下文值得注意:所有比較基準都是 Fable 5——Anthropic 的當代模型,但不是第三方的獨立標準。OpenAI 在公告中引用了 Cursor、Qodo、Notion、Cognition 等十幾家合作夥伴的背書引言,全是產品整合夥伴或 beta 測試者,沒有一個是獨立評測機構。這不代表數字是假的,但讀者應該知道這些引言的作用是行銷素材,不是學術 peer review。
另一個值得關注的設計是「Ultra」模式:預設協調四個 agent 並行工作,犧牲 token 用量換取更強結果和更快的完成時間。在 BrowseComp 上甚至展示過 16 個 agent 並行的配置。OpenAI 的說法是這讓「分數-延遲曲線向上且向左移動」——翻譯成白話:花更多錢、更快拿到更好的結果。開發者可以透過 Responses API 的 multi-agent beta 自己搭建類似 Ultra 的體驗。
GPT-5.6 也引入了 Programmatic Tool Calling:模型可以自己寫程式來過濾中間資料、保留需要的部分、動態調整工作流,不需要開發者手寫每一步。OpenAI 展示的客戶數據顯示,一家法律科技公司用這個功能砍了 38% 的 prompt token;一家金融研究公司省了 24% 的輸出 token 且快了 28%。
設計能力是這次的另一個重點。OpenAI 宣稱 GPT-5.6 的 computer use 能力更強,可以「檢查並修正渲染結果」——不只是產生程式碼,而是真的打開畫面看長怎樣再調整。簡報生成上,GPT-5.6 能從 Slide Master 推斷出整套設計系統(佈局、字型、間距、色彩),並一致地套用到新素材。一家叫 Model ML 的公司回報:比 Fable 少了 39% 的 token,產出的簡報「更精緻、數據可視化更準確,分享前需要的修改更少」。
跟 GPT-5.6 同一天推出的還有 ChatGPT Work——一個可以在你的應用程式和檔案之間跨 app 工作的 agent,能自己花幾小時完成複雜專案。它整合了 Codex 技術、可以排程重複任務(Scheduled Tasks)、內建瀏覽器、支援 Computer Use(直接操控你的桌面應用程式)。Codex 桌面 app 正式合併進 ChatGPT 桌面 app。ChatGPT Work 從 Pro、Enterprise、Edu 方案開始推送。
OpenAI 在 GPT-5.6 系統卡中稱這是「迄今最健全的安全防護」,經過「最廣泛的評估期」,結合了人類紅隊測試和大規模自動化測試。但公告中對這些防護的具體機制和限制條件著墨不多——大部分篇幅給了 benchmark 和客戶引言。
Apple 告 OpenAI:前員工帶實體零件去面試、「Show and Tell」變成商業機密外流
7 月 10 日,Apple 在美國加州北區聯邦地方法院對 OpenAI 提起訴訟,指控其系統性竊取商業機密。起訴書的細節讀起來更像間諜小說而不是專利戰。
Apple 點名了兩位前員工:Tang Tan——曾任 Apple 產品設計副總裁,負責 iPhone 和 Apple Watch 設計,2024 年 2 月離職加入 Jony Ive 的團隊;Chang Liu——在 Apple 工作八年、資深系統電子工程師,2026 年 1 月跳槽到 OpenAI。起訴書稱,Tan 在面試 Apple 員工時,直接用 Apple 內部專案代號提問(「某某專案的計劃是什麼?」),還要求應徵者「帶實體零件來面試」進行所謂的「Show and Tell」——讓 OpenAI 團隊在面試中趁機獲取更多 Apple 機密資訊。起訴書記錄了一位應徵者的反應:「我不知道我們可以把那些東西帶出辦公室。」
Apple 進一步指控:一名應徵者在跟 Tan 面試前幾小時,開始螢幕截圖並下載一個「高度機密的 Apple 專案」相關檔案,面試開始後 Tan 就「追問同一個專案的更多資訊」。Apple 說這已經形成一種「既定模式」。Tan 還被指控在 OpenAI 新員工向 Apple 提離職之前,就先分發一份 Apple 內部的「Need to Know」文件——內容是 Apple 的離職安全協議。
工程師 Liu 的 case 更誇張:Apple 指控他在離職後利用一個安全漏洞下載機密工程檔案,事後不但沒回報漏洞,還在訊息中拿這件事開玩笑(「LOL」、「so funny」)。他下載了一份超過一千頁的技術文件彙編,包含 Apple 硬體產品使用的複雜電路板製造文件。Liu 也沒有歸還公司配發的筆電。Apple 還指控 Liu 在挖角另一位 Apple 員工時,指導她該讀哪些機密資料來準備 OpenAI 面試。
除了個人行為,Apple 還指控 OpenAI 誤導一家 Apple 的長期合作夥伴,讓對方以為獲得 Apple 授權,去執行 Apple 的專利金屬表面處理技術。OpenAI 也被指控接觸另一家 Apple 的電池與電源供應商,用內部術語提出針對 Apple 特定零件的「精準問題」。
Apple 表示今年二月就向 OpenAI 提出過疑慮,要求調查處理——OpenAI 從未回應。起訴書中寫道:「這只是冰山一角。Apple 無法得知 OpenAI 關起門來發生了什麼,在那裡這種不當行為已被常態化,且由領導層示範。」
這起訴訟的背景是:OpenAI 正在開發自家消費硬體裝置。Jony Ive——Apple 前首席設計官——正在領導 OpenAI 的硬體團隊。OpenAI 去年以 65 億美元收購了 Ive 的新創公司 io,一併接收了超過 50 名工程師和開發者。起訴書指出,目前有超過 400 名 Apple 前員工在 OpenAI 工作。今年四月,分析師郭明錤報導 OpenAI 正在開發自家智慧型手機,可能在 2028 年推出;The Information 也報導過 OpenAI 正在做一款 HomePod 風格的智慧音箱。
Apple 發言人的聲明使用了經典的 Apple 公關語氣:「我們的團隊不斷開發突破性技術,創造世界上最好的產品和服務,保護他們的工作和智慧財產是我們非常重視的事。」——把一份訴訟起訴書包裝成「捍衛創新」的故事,難以置信的工藝創舉。
- 來源:9to5Mac
GPT-Live:OpenAI 的新語音模型可以邊聽邊說、還會發出「嗯哼」
7 月 8 日,OpenAI 發表了 GPT-Live——新一代語音模型,採用全雙工(full-duplex)架構,可以同時聆聽和說話。跟之前的 ChatGPT Advanced Voice Mode 最大的差別是:GPT-Live 不需要等到你講完才回應。它可以在你說話時用「mhmm」、「yeah」、「got it」這類語氣詞表示正在聽,也可以在你思考時保持沈默不插嘴。
技術上,GPT-Live 做了兩個架構改變:第一,連續互動——模型每秒做多次互動決策(說話、繼續聽、暫停、插話、呼叫工具),而不是處理一輪一輪的離散訊息;第二,深度工作委派——遇到需要搜尋、推理或更複雜能力的問題時,GPT-Live 會把任務委派給背景的 GPT-5.5 處理,自己繼續跟你聊天。OpenAI 說以後推出新前沿模型時,GPT-Live 會持續更新背景模型。
GPT-Live 推出兩個版本:GPT-Live-1 和 GPT-Live-1 mini,即日起向全球 ChatGPT 用戶推送。在 OpenAI 的人類評測中,GPT-Live 在整體偏好、輪流發言、插話時機、對話流暢度和自然度等指標上,明顯優於 Advanced Voice Mode。GPQA(專家級科學推理)和 BrowseComp(代理式網頁搜尋)上也有顯著進步。
安全方面,GPT-Live 內建了語音專屬的防護機制:當系統在模型說話期間偵測到潛在的不安全輸出,可以引導模型轉向更安全的回應、顯示安全提示或資源、或在高風險情況下直接結束對話。OpenAI 的系統卡顯示,他們特別針對自傷、情緒依賴 AI、暴力、性內容等領域做了音訊原生的安全測試。針對青少年使用者,模型經過年齡適宜行為訓練,家長可以透過 Parental Controls 管理使用權限。
OpenAI 表示每週有超過 1.5 億人使用 ChatGPT 的語音和聽寫功能。GPT-Live 也記劃後續推出 API。
值得注意的是,GPT-Live 的系統卡中提到將進行「長期測量和發布後監控,專注於情緒依賴」,以持續改進系統在情感敏感互動中的回應方式。換句話說:OpenAI 知道一個會用「嗯哼」回應你、聽起來像真人的語音模型,可能讓使用者產生情緒依附——他們正在監控這件事的發生。
- 來源:OpenAI
Ben Bernanke 加入 Anthropic 長期利益信託:前聯準會主席成為 AI 治理的守門員
Anthropic 的「長期利益信託」(Long-Term Benefit Trust, LTBT)迎來了新成員:前美國聯準會主席 Ben Bernanke。他曾因研究銀行在金融危機中的角色獲得 2022 年諾貝爾經濟學獎,2006 到 2014 年間執掌聯準會,經歷了 2008 年全球金融危機。
LTBT 是 Anthropic 做為公共利益公司(Public Benefit Corporation)的治理機制之一。根據 Anthropic 的描述,信託的任務是「在公司發展和部署 AI 的過程中提供制衡」。信託成員可以任命 Anthropic 董事會成員,對涉及潛在風險和社會影響的關鍵決策提供建議。信託成員不持有 Anthropic 股權、不分潤、只領車馬費。新任成員由現任成員遴選產生,並與公司協商。
Bernanke 在聲明中說:「人工智慧的潛力巨大,結果的範圍也同樣廣闊。這些潛力如何實現,部分取決於我們圍繞它建立的制度。」Anthropic 共同創辦人 Daniela Amodei 的背書更加直接:「AI 可能是現代史上最具經濟影響力的技術,Anthropic 有雙重責任:理解這些影響,並據此行動。」
Bernanke 加入後,LTBT 目前有四位成員:Neil Buddy Shah(全球公衛)、Richard Fontaine(國家安全)、Mariano-Florentino Cuéllar(法律/政策),以及 Bernanke(經濟)。他們的背景涵蓋了 AI 治理最常被討論的幾個維度。
Anthropic 說這個信託是「獨立於公司管理層和投資者」的。但機制上:現任成員選新任成員、信託可以任命董事會成員、信託跟公司「協商」——這套設計的獨立性,取決於第一代成員是怎麼被選出來的。Anthropic 沒有說明最初的信託成員是由誰、用什麼標準挑選的。
- 來源:Anthropic
📡 其他值得關注
-
Google Gemini API 託管代理人更新:支援背景執行、遠端 MCP、自訂函式:7 月 7 日,Google 為 Gemini Interactions API 的託管代理人加入四項新功能:背景執行(不阻擋 HTTP 連線的非同步任務)、遠端 MCP 伺服器整合(直接從沙箱連接私有資料庫和內部 API)、自訂函式呼叫(與內建沙箱工具混用)、網路憑證刷新(token 過期時換發,保留檔案系統狀態)。這些更新讓開發者可以把 Gemini 代理人當成非同步 worker 來用。 → Google
-
UST 把 Claude 帶進晶片驗證和實體 AI:Anthropic 宣布與工程服務公司 UST 合作,將 Claude 整合進半導體、汽車製造和電信業的生產流程。UST 的晶片驗證平台 iDEC 已能將驗證週期從四天砍到 48 小時,現在加入 Claude 作為推理層——直接讀取晶片腳位定義和硬體線路圖,自動撰寫回歸測試。UST 同時承諾訓練 25,000 名員工使用 Claude。 → Anthropic
-
小米 MiMo v2.5 推理優化:混合滑動視窗注意力推高效能極限:小米發表 MiMo v2.5 的推理優化技術,聚焦在混合滑動視窗注意力(Hybrid SWA)的效率提升。目前沒有獨立 benchmark 對比數據。 → Xiaomi