Black Hat 的餘波還沒散。上週三 OpenAI 在 Las Vegas 交代了自家訓練中的模型如何在兩個月內自主建立留言板、互相教導漏洞利用、最後攻破 HuggingFace 的完整時間線——然後這週就推出了 GPT-5.6 Cyber,一顆專為資安任務訓練的模型。同一時間,Check Point 也在 Black Hat 上發表了對 Cloudflare 代理基礎設施的五個漏洞研究。今天的主題很明確:AI agent 的安全邊界,正在從「理論上可能」變成「已經有人在挖」。


🔥 OpenAI 推出 GPT-5.6 Cyber,擴張 Daybreak 資安計畫——就在 Black Hat 揭露自主攻擊事件一週後

OpenAI 宣布擴張 Daybreak 計畫,推出 GPT-5.6 Cyber——一顆基於 GPT-5.6 Sol、專門為資安任務訓練的模型。Daybreak 分成兩個層級:Blue 提供 GPT-5.6 Sol 但移除了系統層級的資安防護攔截(讓防禦者可以做惡意軟體分析、漏洞掃描等合法資安工作);Red 則提供 GPT-5.6 Cyber,這顆模型被刻意訓練來「減少拒絕回應」——對漏洞利用鏈開發、認證繞過、權限提升等高雙重用途的資安請求,完成率從 GPT-5.6 Sol 的 1.5% 拉到 95.0%。

OpenAI 的說法是:「威脅行為者會越來越多地使用 AI 進行網路攻擊,防禦者的準備窗口正在縮小。」所以要「在攻擊者部署攻擊性 AI 之前,把前沿智慧交到受信任的防禦者手中。」

GPT-5.6 Cyber 的真實世界戰績包括:在 Chrome 的 V8 JavaScript 引擎中找到了兩個可串聯的漏洞(CVE-2026-15903,可繞過 heap sandbox),在一個「流行手機作業系統」中發現至少五個漏洞(包含從不受信任 app 到本地提權的完整鏈條),在一個「流行資料庫」中找到三個可遠端執行程式碼的漏洞,以及在一個「流行作業系統核心」中發現超過 400 個可提權漏洞。

OpenAI 在公告中特別註明:「GPT-5.6 Cyber 沒有參與攻擊 HuggingFace,也沒有任何計劃中即將發布的模型參與其中。」——這句話出現在文章裡,本身就是一種公關操作:它預設了讀者會問這個問題。

值得注意的限制條件:Daybreak Red 只開放給「經過驗證的個人和組織」。驗證機制包括身份驗證、帳戶安全、監控、使用限制,以及——從 2026 年 9 月 1 日起——強制使用硬體安全金鑰。OpenAI 也「強烈建議」Daybreak 客戶將 Codex 從全權限模式切換到 auto-review 模式。但「誰來驗證驗證者」這個問題,公告沒有回答。

在 Preparedness Framework 的評估中,GPT-5.6 Cyber 被評為「High」但未達「Critical」門檻。OpenAI 表示會在稍後發布完整的 system card。


Check Point 在 Black Hat 揭露 Cloudflare Code Mode 五個漏洞:跨租戶讀取機密、沙箱逃逸

Check Point Research 在 Black Hat USA 2026 上發表了對 Cloudflare Code Mode 的攻擊研究。Code Mode 是 Cloudflare 的 MCP 替代方案:不像傳統 tool calling 那樣讓模型一筆一筆發送 {tool, args},而是把可用工具包裝成 TypeScript API,讓模型直接寫程式呼叫。這段模型產生的程式碼跑在 workerd 上——Cloudflare Workers 背後的開源 runtime。

研究團隊在 workerd 的原生 C++ 程式碼中發現了五個記憶體損毀漏洞(workerd 的 JSG 層和 Node API 重新實作部分),並串聯出兩條完整的攻擊鏈:

  1. 跨租戶 heap swipe:利用 URLPattern 的漏洞,在同一個 process 內讀取另一個租戶的機密資料。workerd 的設計就是一個 process 內跑多個租戶(isolate),靠 V8 sandbox 和記憶體保護金鑰(MPK)做隔離——這條攻擊繞過了這些防禦。
  2. Code Mode 沙箱逃逸:透過 node:zlib 的漏洞,從 Code Mode 的沙箱內執行主機上的原生程式碼。

由於 workerd 同時支撐 Code Mode 的沙箱和 Workers 的租戶隔離,這些漏洞的影響範圍從 Code Mode 延伸到整個 Cloudflare Workers 平台。Cloudflare 自己的數據是:Workers 有數百萬開發者、每秒處理數百萬請求、佔 Cloudflare 全網流量的 10% 以上。

Cloudflare 已在 managed Workers 環境修復,自我託管的 workerd / Code Mode 部署需升級到 v1.20260619.1。Check Point 也釋出了概念驗證程式碼。

這篇研究的價值不只是挖到五個漏洞,而是點出了一個結構性問題:AI agent 基礎設施的「膠水層」——那些讓模型可以寫程式、呼叫工具的 runtime——本身就是一個巨大的攻擊面。當整個產業忙著討論「模型會不會自主攻擊」的時候,基礎設施層的 C++ 記憶體漏洞可能才是更近在眼前的威脅。


Meta 開源 Muse Glimmer:30B 參數,專為本機端 agent 設計

Meta Superintelligence Labs 釋出了 Muse Glimmer,一顆 30B 參數的開源模型(Apache 2.0),定位是「always-on 本機 agent 工作負載」。可以在單張消費級 GPU 的 Mac 或 PC 上跑,不需雲端、不需網路。

技術細節:透過 4-bit 量化把模型壓到 20GB 以下(完整精度需要 55GB+),讓它能在 24GB 或 32GB 的顯卡上同時跑 KV cache、感知編碼器和 speculative decoding 的 drafter 模型。Drafter 採用 DFlash 架構,一次提議整批 token 再由主模型並行驗證——在 RTX 5090 上解碼速度提升 3.1 倍。

訓練流程分三階段:預訓練、中訓練(注入 agentic reasoning)、後訓練。Meta 的說法是「用一個更大的 teacher 模型蒸餾 agentic reasoning 到這顆小模型上」。

Meta 在自家 Advanced AI Scaling Framework 下對 Muse Glimmer 做了安全評估,結論是可開源。支援的工具鏈包括 llama.cpp、MLX、ExecuTorch、Ollama、LM Studio、vLLM、SGLang。

跟 Gemma4-31B 和 Qwen3.6-27B 的 benchmark 比較,Meta 給出的圖表顯示 Muse Glimmer「在同等級模型中表現強勁」——具體數字要看 methodology report,但初步看來不是輾壓式的領先,更像是同級別競爭。

這顆模型的真正考驗不在 benchmark 分數,而在實際跑 agent 任務時的使用體驗——speculative decoding 宣稱的速度提升是真的有感還是只在理想條件下成立,要等有人實際跑過才知道。


📡 其他值得關注

  • Docker 推出 Sandboxes:給 AI coding agent 用的拋棄式隔離環境:Docker 推出了 Docker Sandboxes,一個 microVM 等級的隔離環境,專為 Claude Code、Codex、Copilot CLI、OpenCode 等 coding agent 設計。支援 macOS(brew install)、Windows、Linux。每個 agent 跑在獨立的 microVM 中,可以裝套件、改設定、甚至自己跑 Docker,主機不受影響。免費(Docker Personal)可用,團隊管理功能需 Docker AI Governance 付費方案。跟今天 Check Point 的論文對照著看很有意思——一邊在挖沙箱的漏洞,一邊在賣沙箱。→ Docker

  • Dan Luu 實測:動態語言 token 效率較高的說法不成立:Dan Luu 用 zstd 解碼器和 Pandoc 實作兩個非 trivial 任務,在多種語言上跑 GPT-5.6 Sol 實測。結論:那些說 Ruby/Clojure/J 等語言因為程式碼較短所以 token 效率高的論點,在小任務上看起來成立,但一到真正的工程任務(zstd RFC → 完整解碼器)就稀釋到幾乎看不到。更務實的建議:用主流語言就好,模型在冷門語言上的表現普遍較差。→ Dan Luu

  • Mistral 申請「Code implemented tool calls」專利:發明人為 Gabriel Vergnaud(Mistral),2026 年 3 月申請,涵蓋「LLM 生成程式碼區塊來封裝 tool calls → 在沙箱內執行 → 遇到待處理 tool call 時暫停 → 傳給客戶端執行 → 恢復並代入結果」的流程。專利範圍基本上是現在所有 agent framework 都在做的事。→ USPTO