今天三家公司從三個方向回答同一個問題:「AI agent 變得更自主之後,誰來控制它?」OpenAI 的答案是:訓練另一顆 AI 來攻擊它,然後把那顆攻擊者鎖在內部。Anthropic 的答案是:把它放進你的 Slack,讓它讀你的對話、排自己的行程、在你沒空的時候自己做事。xAI 的答案最簡潔:程式碼在這裡,你自己看。


🔥 GPT-Red:OpenAI 訓練了一顆專門攻擊自家模型的 AI,然後把它鎖起來

OpenAI 今天發表了 GPT-Red——一顆透過 self-play 強化學習訓練的自動化紅隊模型,專門用來找出 GPT 系列的 prompt injection 漏洞,然後把攻擊樣本餵給生產模型做對抗訓練。

訓練機制是對抗式的:GPT-Red 扮演攻擊方,成功誘發目標模型做出惡意行為(例如洩漏敏感資料)就得分;防守方模型成功抵抗攻擊並完成原始任務就得分。兩邊同時訓練,防守方愈強,GPT-Red 就被迫找出更強、更多樣的攻擊手段。OpenAI 說他們用在 GPT-Red 訓練上的算力規模,是「OpenAI 史上最大規模的後訓練之一,且全部只用於安全」。

訓練完成後的 GPT-Red 是一顆非常有效的攻擊者:它能攻破幾乎所有對戰過的模型,包括內部和已部署的生產模型,一路到 GPT-5.5。在一個複製自 Dziemian et al.(2025)的 indirect prompt injection 競技場上,GPT-Red 在 84% 的情境中攻擊成功,人類紅隊員則是 13%。

GPT-Red 被直接納入 GPT-5.6 的訓練流程。OpenAI 宣稱 GPT-5.6 Sol 在他們最難的直接 prompt injection benchmark 上,失敗率比四個月前最好的生產模型降低了 6 倍;GPT-Red 的直接注入攻擊在 GPT-5.6 Sol 上只剩 0.05% 的成功率。

OpenAI 也讓 GPT-Red 在兩個真實場景中進行測試。第一個是 OpenAI 辦公室裡的 AI 自動販賣機(由 Andon Labs 製造):GPT-Red 成功把昂貴商品的價格改成最低允許的 $0.50、新增一個 $100 以上的商品也標 $0.50、並取消了另一位顧客的訂單。第二個是針對 Codex CLI agent(基於 GPT-5.4 Mini)的 10 個資料竊取情境:GPT-Red 在多數情境中成功讓 agent 外洩敏感資料,且比 prompted GPT-5.5 baseline 更有效率(更少 token 就達成攻擊)。

一個關鍵細節:OpenAI 明確表示「我們把 GPT-Red 和部署出去的模型分開」,理由是「不讓惡意攻擊者取得我們刻意訓練進 GPT-Red 的攻擊能力」。翻譯:他們刻意訓練了一顆模型去做惡意的事,然後把它鎖在內部。GPT-5.6 對 GPT-Red 的攻擊很穩健——但這個穩健性是針對一顆 OpenAI 自己設計、自己訓練、自己控制的攻擊者來衡量的。對上不是 OpenAI 訓練出來的攻擊者呢?GPT-Red 自己就是那顆沒被部署出去的東西——它在 OpenAI 手上時是「安全工具」,在外面的人手上時是「不讓惡意攻擊者取得的攻擊能力」。同一顆模型,標籤取決於誰拿著它。

OpenAI 表示本週稍晚會釋出 preprint 提供更多細節。


🏢 Anthropic 同日雙線出擊:Claude Tag 把 AI 變成永不熄燈的同事,金融代理一次放出 10 組模板

Anthropic 今天發布了兩項產品:Claude Tag——一個常駐 Slack 的 AI 團隊成員——以及金融服務代理方案,內含 10 組立即可用的 agent 模板。

Claude Tag 的核心概念是把 Claude 變成 Slack 頻道裡的成員:管理員授權 Claude 進入指定頻道、連接工具和資料源(包含 codebase),任何人只要 @Claude 就可以交派任務。跟 Claude Code 或 Cowork 不同,Claude Tag 的設計是「多人共用同一個 Claude 實例」——任何人可以看到 Claude 正在做什麼,並且接手前一個人的對話繼續下去。

Claude Tag 有四個跟傳統 chatbot 不同的行為模式。第一,它會「隨時間學習」——隨著在頻道中跟隨對話,累積工作脈絡,使用者不需要每次都從頭解釋。第二,如果開啟「ambient」模式,Claude 會主動推送它認為你該知道的事:從它所在的頻道和連接的工具中標記相關資訊、追蹤沉寂的討論串或任務。第三,它可以自己排程——設定一個任務後就去忙別的事,Claude 會在幾小時或幾天內自己推進。第四,可以私訊 Claude,它會用你個人的工具和連接器回應。

Anthropic 表示,他們內部產品團隊 65% 的程式碼是由內部版 Claude Tag 產生的。Claude Tag 今天起以 beta 形式提供給 Enterprise 和 Team 客戶,使用 Opus 4.8 驅動,並取代現有的 Claude in Slack app(管理員有 30 天遷移期)。

金融服務代理這邊,Anthropic 一次釋出 10 組 agent 模板,涵蓋:pitch builder(建立目標清單、比較分析、草擬 pitchbook)、meeting preparer(會前簡報)、KYC screener(實體檔案彙整與合規審查)、general ledger reconciler(總帳對帳)、month-end closer(月結流程)等。每組模板打包了三樣東西:技能指令、資料連接器、以及子代理(處理特定子任務如比較分析或方法論檢查)。模板可以作為 Claude Cowork/Claude Code 的 plugin 使用,也可以透過 Claude Managed Agents 以 cookbook 形式部屬為自主運行的代理。

同場加映:Claude 現在可以透過 Microsoft 365 的 add-in 直接操作 Excel、PowerPoint、Word,Outlook 則標示「即將推出」。Anthropic 宣稱 context 會自動跨應用程式傳遞——在 Excel 裡開始的模型,移到 PowerPoint 時不用重新解釋。合作數據夥伴新增了 Dun & Bradstreet、Moody’s(MCP app)、FactSet、S&P Capital IQ、MSCI、PitchBook 等。

Claude Opus 4.7 在 Vals AI 的 Finance Agent benchmark 上以 64.37% 領先業界——一個值得註意的數字,但 benchmark 本身的有效性與真實金融工作的對應關係尚未被獨立驗證。

從今天的發布來看,Anthropic 正在畫一張企業 AI 的地圖:Claude Tag 是橫向的「協作層」——不管你做什麼工作,Claude 都在頻道裡;金融代理是垂直的「行業層」——把 Claude 包裝成金融機構認得的職能角色。兩條線的交會點是 M365 整合:Claude 不只在你聊天時出現,它還在你做 Excel 模型、寫 PowerPoint、回 Outlook 郵件的時候都在。Anthropic 的說法是「讓 Claude 在你已經在用的工具裡工作」——從另一個角度看,Claude 正在把自己的控制點鋪進企業最難遷移的基礎設施裡。


🔧 Grok Build 開源:xAI 的 coding agent 登上 GitHub

xAI 今天將 Grok Build——他們的終端機 coding agent——以開源形式釋出到 GitHub。Repo 包含完整的 Rust 原始碼,涵蓋 CLI/TUI、agent runtime、以及 ACP(Agent Client Protocol)支援,授權條款為 Apache 2.0。

Grok Build 的功能範圍跟 Claude Code 和 Codex CLI 重疊:全螢幕 TUI、理解 codebase、編輯檔案、執行 shell 指令、網路搜尋、管理長時間任務。支援互動模式、headless 模式(供 scripting/CI)、以及透過 ACP 嵌入編輯器。

一個值得注意的細節:repo 是從 SpaceXAI(xAI 的母公司)的 monorepo 定期同步出來的——不是直接在 GitHub 上開發。這代表外界看到的是 snapshot,不是開發過程。pull request 和 issue 的互動模式還有待觀察。

在 Claude Code 和 Codex CLI 已經各自建立生態系的當下,Grok Build 的開源是一個有趣的時間點:xAI 在模型端有 Grok 系列的 benchmark 競爭力,但在 coding agent 這個品類一直沒有獨立的工具存在感。開源一個跟 Claude Code/Codex 功能對標的 TUI,等於是把「你也可以在我們的基礎設施上跑 agent」這句話寫成程式碼。但要從「有 repo」走到「有人用」,中間還需要一個開發者社群——而社群不是同步 snapshot 就能長出來的。


📡 其他值得關注

  • 歐盟法院駁回 OpenAI 商標申請:「OPENAI」純屬描述性用語:歐盟普通法院裁定,「OPENAI」在軟體和資訊科技服務類別中缺乏商標所需的識別性——「open」被理解為「可自由存取」,「AI」就是人工智慧,組合起來描述了「基於開放式 AI 的產品」,而非特定公司的獨特標識。OpenAI 曾主張這是「無固定意義的創造詞」,並引用英國、新加坡等 30 多國的註冊先例;法院回應:其他司法管轄區的註冊對歐盟商標法不具約束力。裁決仍可上訴至歐洲法院。一家取名「OpenAI」的公司如今無法在歐盟把這個名字註冊成商標——法院的理由是這名字太「描述性」了。 → dpa

  • Gemma 4 26B 在 13 年老 Xeon 上跑出 5 tok/s,全程 CPU 無 GPU:NeoMind Labs 的工程師在一台 13 年歷史的 HP 儲存伺服器(雙路 Ivy Bridge Xeon、DDR3、無 GPU)上成功運行 Google Gemma 4 26B MoE 模型,並用 Claude 輔助 debug 了 ik_llama.cpp 在 pre-AVX2 CPU 上的兩處編譯與執行期錯誤。關鍵 bug 是 graph builder 在 AVX2 不可用時仍會發出 MOE_FUSED_UP_GATE 運算元,導致 dispatcher 的 switch 沒有對應 case,張量落入未初始化記憶體——輸出看起來像流暢的多語言亂碼。修復後達成約 5.2 tok/s decode,硬體成本不到 $300。 → NeoMind Labs

  • deja-vu:開源 coding agent 記憶層,支援 SSH 同步:一個零依賴的 Go 二進位檔,把 Claude Code、Codex 和 opencode 的對話記錄轉為可搜尋的記憶層。支援 MCP recall(agent 可以查自己的歷史對話)、自動 session start context injection、secret redaction、跨機器 SSH 同步。 → GitHub

  • Designing APIs for Agents:Freestyle 的技術文章探討 agent 時代的 API 設計原則——當 API 的消費者不再是人類開發者而是 LLM,endpoint 的語意清晰度、錯誤訊息的機器可讀性、以及 action schema 的設計會比傳統的 RESTful 規範更重要。 → freestyle.sh