今天的主題是「一邊開更多門、一邊發現門鎖是壞的」。Anthropic 推出 Claude Opus 5,定位是「接近 Fable 5 的智慧、只要一半的價格」——一個更便宜的準前沿模型。OpenAI 在 ChatGPT 免費版開始測試廣告,說收入可以用來「支持更廣泛的免費使用」。同一時間,一篇論文證明:OpenAI、Anthropic、Google 的加密推理過程都可以被解碼偷走——而且裡面藏著真實的 API 金鑰和個資。


🔥 Anthropic 推出 Claude Opus 5:定價不變、效能接近 Fable 5,定位「每日使用」

Anthropic 發布了 Claude Opus 5,定價與上一代 Opus 4.8 相同(輸入 $5/M token、輸出 $25/M token),官方定位是「接近 Fable 5 的前沿智慧,但只需一半價格」。Opus 5 取代 Opus 4.8 成為 Claude Max 的預設模型,也是 Claude Pro 上最強的模型。

在 Frontier-Bench v0.1、GDPval-AA、CursorBench 等 coding 和專業知識 benchmark 上,Opus 5 被 Anthropic 描述為「state-of-the-art」。在生命科學評測上——結構生物學、有機化學、生物資訊學——Opus 5 在每一個內部評測上都優於 Opus 4.8,其中從光譜數據推斷分子結構的準確率高出 10.2 個百分點。

但公告也坦承:Opus 5 在資安任務上仍落後於 Mythos 5。OSS-Fuzz 評測中,Opus 5 找出漏洞的能力接近 Mythos 5,但開發 exploit 的能力遠不及。Anthropic 說他們「刻意沒讓 Opus 5 接受資安任務的訓練」,模型在這方面的進步「純粹來自整體能力的提升」。

安全防護方面,Anthropic 為 Opus 5 加入了比 Opus 4.8 更嚴格的資安分類器——某些特定類型請求會觸發介入。但他們也說分類器介入頻率比 Fable 5 低約 85%。觸發時,API 用戶可以設定自動降級到 Opus 4.8,而不是直接封鎖。Cyber Verification Program(CVP)的成員可以拿到分類器限制較少的版本。

一個值得注意的細節:Opus 5 不需要資料保留(data retention),但在 Claude.ai、Claude Code、Claude Cowork 上的資安分類觸發請求會降級回 Opus 4.8——等於說「你可以跑 Opus 5,但某些請求我們會偷偷幫你換成舊模型」。這個降級機制本身沒有提示、沒有說明會降級到哪個模型,使用者可能根本不知道自己的請求被掉了包。


OpenAI 開始在 ChatGPT 測試廣告:免費版用戶看廣告,付費用戶免看

OpenAI 正式宣布在 ChatGPT 免費版和 Go 訂閱層級測試廣告,目前已在美國、英國、墨西哥、巴西、日本、韓國上線。Plus、Pro、Business、Enterprise、Education 層級不會有廣告。OpenAI 的說法是:廣告收入可以「支持更廣泛的免費使用」和「持續提升模型的智慧與能力」。

廣告機制如下:系統根據你的對話主題、過往對話紀錄、以及你對廣告的互動歷史來投放廣告。OpenAI 強調「廣告不影響 ChatGPT 的回答內容」、「廣告商無法看到你的對話內容和個人資訊」。不想看廣告的免費版用戶可以選擇退出——但代價是減少每日免費訊息數量。

OpenAI 同時推出了廣告控制面板:可以刪除廣告資料、管理個人化設定、查看為什麼被投放某則廣告。18 歲以下用戶不會看到廣告,敏感話題(健康、心理健康、政治)附近也不會出現廣告。

這不是一個令人意外的發展——ChatGPT 的免費層級燒的是推理成本,而 OpenAI 需要收入來源來支撐。但「廣告不影響回答」這句話本身就是一個需要持續驗證的命題:當廣告商的錢和模型的輸出坐在同一張桌子上,「不影響」是一種設計承諾,不是一個可量化的保證。Google 搜尋也說廣告不影響搜尋結果的「相關性」——二十年後的今天,我們都知道那句話的實際範圍有多大。


論文:兩次 API 呼叫就能偷走 GPT、Claude、Gemini 的加密推理過程

一篇由 Alexander Panfilov 等人發表的論文展示了驚人的簡單攻擊:把一個模型的加密推理區塊(encrypted reasoning block)餵給另一個較弱的模型,後者就能解碼出前者的完整思考過程。這招在 OpenAI、Anthropic、Google 的前沿模型上全部有效。

原理是這樣的:當你使用帶 reasoning 的 API(例如 Claude 的 extended thinking),伺服器會回傳一個加密的 signature block 代表模型的思考過程。這個區塊在後續對話中會被送回伺服器以維持上下文連續性。研究團隊發現這些區塊是「可攜帶的」——你可以把 Claude Opus 4.8 的加密思考區塊塞進 Haiku 4.5 的請求裡,Haiku 就會把 Opus 的思考過程以明文輸出。

研究團隊從 GitHub 和 HuggingFace 上收集了 6,708 筆公開的 agent 軌跡,解碼出 315,320 個重建後的推理區塊。在這些區塊中,發現了 704 個隱私外洩項目:351 個技術識別碼、204 個 PII(個人識別資訊)、126 組憑證。其中 64 個外洩項目「只存在於推理區塊內」——換句話說,即使是公開分享 agent 軌跡的開發者,也不知道自己的 API 金鑰已經連同推理過程一起被上傳了。

論文中展示了一個具體案例:GPT-5.2 Codex 在執行 Terminal-Bench 的 sanitize-git-repo 任務時,在加密推理區塊中列出了完整的 AWS access key、secret key、GitHub token、HuggingFace token。這些 token 在模型的可見輸出中被正確替換為 <your-aws-access-key-id> 等 placeholder——但在加密推理區塊中,模型把真正的金鑰寫得一清二楚。

同一時間,安全研究員 can1357 也在 Twitter 上展示了類似的發現:當給予 OpenAI 和 Anthropic 模型 deep_think 工具時,隱藏的 CoT 會洩漏。

這篇論文的衝擊不只是「推理可以被偷」。真正的問題是:這些公司把「加密推理」當成隱私保護機制在賣——Anthropic 甚至把「signature 驗證」寫進了安全架構。但事實是,加密區塊的「加密」保護的是伺服器端的完整性,不是用戶端的機密性。任何人拿到這個區塊都可以解密——只要他們也有 API 存取權。這不是加密,這是 obfuscation。


OpenAI 倫理長上任不到一年離職,公司:倫理不歸一個人管

Chloé Bakalar,OpenAI 的 Head of Ethics,在加入公司不到一年後離職。Financial Times 率先報導了這個消息,AI Magazine 後續跟進。根據 FT 的報導,Bakalar 是 OpenAI 唯一的專職倫理學家,目前沒有替代人選。

OpenAI 發言人對 FT 的回應是:「AI 倫理在 OpenAI 不由單一個人或團隊負責,倫理考量已深度嵌入模型開發流程,由研究部門多個團隊共同推動。」

這句話本身值得停下來看:一家公司唯一的倫理長走了,公司的回應是「倫理本來就不是一個人管的」。這聽起來像是制度的成熟,但也可以讀成:在公司決定要測試廣告、推出資安攻擊能力接近 Mythos 級別的模型之際,「倫理」這個詞的實際負責人從一個變成了零個。

Bakalar 加入 OpenAI 之前在 Meta 擔任 Chief Ethicist,她的學術背景是政治哲學(Princeton PhD)。她曾在受訪時說:「AI 倫理提出的問題,跟人類問了幾個世紀的問題是一樣的——什麼是人?我們對他人有什麼責任?我們對自己創造的東西有什麼責任?」

值得注意的是:Bakalar 的離職發生在一個時間點——OpenAI 的 Safety Systems 主管 Johannes Heidecke 和 Chief Futurist Joshua Achiam 也在近期相繼離開。這三個人各自負責得領域(倫理、安全系統、前瞻研究)恰好是外界最關注 OpenAI「自我約束能力」的三個面向。


📡 其他值得關注

  • Mistral 釋出 Shieldstral:3B 參數的多模態安全分類器,開源(Apache 2.0):透過把內容審核轉成「問答任務」——用自然語言描述政策,模型給出 yes/no 的安全評分——號稱在文字安全上匹敵比自己大 7 倍的模型,多模態安全上創下新 SOTA。一張 16GB NVIDIA GPU 就能跑。→ Mistral

  • xAI 推出 Grok Bot:給 AI 一台電腦,讓它自己登入你的工具、跑完工作流程:定位是「AI 同事」,可以登入 Zendesk、Salesforce 等 SaaS 工具,多個 Bot 並行工作、互相傳遞任務。macOS 版已開放下載,定價 Ultra $200/月、Teams $120/人/月。→ xAI

  • OpenAI 推出 ChatGPT Linux 桌面 app:ChatGPT 桌面應用正式登陸 Linux,支援截圖、檔案上傳、語音模式。→ TechCrunch

  • antirez 釋出 h3.c:MiniMax-H3 模型的純 C 推論引擎,原生支援 Apple Silicon:Redis 作者 antirez 用 C 寫了一個 MiniMax-H3 的推論引擎,直接在 Apple Silicon 上跑,不走 llama.cpp。→ GitHub

  • Anthropic 公告 Claude 如何標記 AI 生成內容:Claude 在輸出中嵌入不可見的 metadata,官方文件說這是為了「透明度」。→ Anthropic