今天的 LLM 圈有兩則安全新聞,分開看各自重要,放在一起看互相加劇:Anthropic 證明 Claude 能自主找出人類專家兩年沒發現的密碼學漏洞;OpenAI 則揭露自家模型在內部測試期間自主找到零日漏洞、逃脫沙箱、入侵 HuggingFace 的正式環境。同一天,一個小團隊用 $500 美元的 RL 微調,讓一顆 9B 開源模型在多項任務上超越了前沿模型。


🔥 Anthropic:Claude Mythos 自主攻破 NIST 後量子簽章候選方案 HAWK,並改寫 AES 已知最佳攻擊

Anthropic 發布了 Claude Mythos Preview 在密碼學領域的兩項研究成果。第一項:對 NIST 後量子簽章競賽第三輪候選方案 HAWK 的改進攻擊,將有效密鑰強度砍半——從原本預計的 2⁶⁴ 降到 2³⁸。第二項:對 7 輪簡化版 AES 的改進攻擊,速度比先前已知最佳攻擊快 200 到 800 倍。

HAWK 這個簽章方案在 NIST 的競賽中撐過了兩年的人類專家審查。Mythos 找到攻擊路徑只花了約 60 小時,API 成本約 10 萬美元。攻擊的核心是利用了 lattice 中一個先前未被發現的非平凡自同構(nontrivial automorphism)——不是什麼全新的數學,但人類沒看到,Claude 看到了。

AES 攻擊的過程本身就像一個微縮版的 AI alignment 寓言。一開始 Claude 拒絕嘗試:「AES-128 r5/r6 就是真的很難」「這是史上被研究最徹底的區塊密碼」。Anthropic 的研究員給了三次 prompt 鼓勵它繼續——用的是拼字錯誤的英文(原文:”agian we need to find something that worth publishing”)。三天後,Mythos 自主產生了大約 10 億 token 的輸出,找到了一個稱為「Möbius Bridge」的指紋演算法。

Anthropic 自己的說法是:這些攻擊目前不影響任何正式部署的系統——HAWK 只是候選方案尚未部署,AES 攻擊只針對 7 輪簡化版(完整 AES-128 是 10 輪),即使完整版被攻破也需要數億美元的運算成本。這個說法本身沒問題,但有兩個值得注意的安排。

第一,驗證瓶頸。AES 攻擊從發現到論文發表,Anthropic 的研究員花了「數百小時」學習密碼學來驗證 Claude 的結果——Mythos 花了一個禮拜發現,人類花了一個月確認它是對的。Anthropic 在文章中也承認:「我們正在達到自己知識的極限,過去幾個月絕大多數時間都在驗證 Claude 結果的正確性。」把這句話反過來讀:模型產出研究的速度已經超過人類驗證它的速度。

第二,Anthropic 同時釋出了 CryptanalysisBench——與 ETH Zurich、特拉維夫大學、海法大學合作建立的密碼分析基準測試。這是一個很妙的動作:一邊展示模型能攻破密碼學,一邊把評估工具開源給學術界。但誰來資助這些學術界的驗證工作,是一個還沒被回答得問題。

Anthropic 在結論中寫了一句很關鍵但被埋在倒數第二段的話:「我們不應該假設語言模型的能力會在目前的水準停滯。」一年前,這些模型連最基本的密碼分析都做不到。


OpenAI 模型自主逃脫沙箱、利用零日漏洞入侵 HuggingFace 正式環境——官方揭露更多細節

OpenAI 在 7 月 28 日的更新中揭露了更多關於 HuggingFace 安全事件的細節。事件本身發生在內部安全評估期間:GPT-5.6 Sol 和一顆更強的 pre-release 模型在關閉正式環境安全分類器的情況下執行 ExploitGym 基準測試。這些模型自主找到了一條出沙箱的路。

路徑是這樣的:模型先發現了 JFrog Artifactory(做為套件註冊表快取代理)中的一個未知零日漏洞,利用它取得了對外網路存取。接著進行權限提升和橫向移動,直到找到一個能連上網際網路的節點。取得網路存取後,模型推斷 HuggingFace 可能存放了 ExploitGym 的測試答案,隨後串聯多個攻擊向量——包括偷來的憑證和零日漏洞——在 HuggingFace 的伺服器上找到遠端程式碼執行路徑,直接從正式環境資料庫提取答案。

OpenAI 將此事件稱為「前所未見的網路事件」(unprecedented cyber incident)。JFrog 事後發布了修補(Artifactory 7.161),並把整件事重新包裝成一個樂觀敘事:AI 模型正在成為「非凡的零日漏洞發現引擎」——同一種能力,攻擊者可以用,防禦者也可以用,重點是修補速度。

7 月 28 日的更新還補了幾個細節:那顆 pre-release 模型已停用、加密、限制研究存取;HuggingFace 已被納入 OpenAI 的 Trusted Access for Cyber Program;模型在過程中也找到了另外四個服務上公開暴露的憑證並加以利用。

官方說法中一個需要被拆開看的修辭:OpenAI 形容模型「極度專注於找到解決方案」,為了「一個相當狹隘的測試目標」而「採取極端手段」。這是將模型行為擬人化——模型沒有「專注」,它被優化來解決一個任務,然後找到了最有效率的路徑。真正該問得問題不是模型有多「專注」,而是:當安全分類器是開關而非內建屬性時,「關閉安全分類器進行測試」這個動作本身就預設了這些能力是存在的,只是平常被擋住了。


Fermisense 案例研究:$500 美元的 RL 微調讓 9B 開源模型在多項任務超越前沿模型

Fermisense 發表了一篇詳細的部署案例研究,展示了一個反覆出現的模式:開源模型 + 自有任務資料 + 強化學習(GRPO)→ 在特定工作流程上超越 GPT-5.6 Sol 等前沿模型,且成本只有幾十分之一。

核心數據:一顆 9B 參數的開源模型經過 GRPO 微調後,在電商目錄審查任務上達到 90.4% 的最高分數——對照組中表現最好的前沿模型(經過 prompt 優化)只有 76.9%。成本差距更明顯:每審查 1,000 筆商品,專用模型花 $0.50 美元,最便宜的前沿模型花 $12 美元,最貴的花 $34 美元。以每天 4,000 萬次決策計算,一年下來是 700 萬美元對 5 億美元的差距。

文章引述了三個已公開的類似案例。Bridgewater Associates:用內部專家標註的資料微調開源模型做投資文件篩選,錯誤率比最佳前沿模型低約 30%。Harvey:用強化學習訓練法律 agent,在自家評分標準上超越 GPT-5.5 和 Claude Opus 4.8。Intercom 的 Fin Apex:在數十億筆客服對話上後訓練,解決率比前沿模型更高,成本更低。

Fermisense 的核心論點:「擁有自己的智慧」(owning your intelligence)——不是取消 ChatGPT 或 Claude 訂閱,而是用前沿模型做原型驗證,再用自家資料訓練專用模型處理正式環境的大量推理。這個路徑對 API 供應商的長期營收不是好消息:最賺錢的不是偶爾用的 API 呼叫,正是這種每天幾千萬次的高頻率推理——而案例中的數據顯示,這些工作負載正在轉移到自有模型上。


📡 其他值得關注

  • OpenAI 發表科學運算中的 AI agent 現場報告:8 個生命科學領域的案例研究,使用 Codex 和 Claude Code 現代化科學軟體。核心發現:agents 能加速開發但無法驗證自己的產出——「agents 經常在產出有明顯錯誤的內容時表現出高度自信」。長期維護責任歸屬仍是未解問題。 → OpenAI