今天的 AI 新聞繞著同一個問題轉:誰來定義「可以」和「不可以」?Anthropic 推出 Claude Opus 5,說它「接近 Fable 5、只要一半價格」——但價格跟上一代 Opus 一模一樣,是 Fable 定太貴還是 Opus 真的變強了?Oracle 對 OpenJDK 說不準用 AI 寫程式碼,同時間 Larry Ellison 到處宣傳「Oracle 的程式都是 AI 寫的」。Mistral 開源了一套 3B 的安全分類器,說安全規則不應該寫死在模型裡——然後把判斷權交給了部署者。Cloudflare 做了一個不給人類用、專給 agent 用的瀏覽器,十二週就生出來了。


🔥 Claude Opus 5 上線:Anthropic 說它「半價 Fable 5」,但價格沒變

Anthropic 正式推出 Claude Opus 5——Opus 系列的換代新作。官方宣稱的定位是:「以 Fable 5 一半的價格,提供接近 Fable 5 的效能。」但拆開來看:Opus 5 定價 $5/M input tokens、$25/M output tokens,跟 Opus 4.8 一模一樣。所謂「半價」是跟 Fable 5 比,不是跟上一代 Opus 比。

效能方面,Opus 5 在 Frontier-Bench v0.1、GDPval-AA v2、CursorBench 3.2 等 coding benchmark 上拿下新的 state-of-the-art。Anthropic 自家評估中,Opus 5 的有機化學任務比 Opus 4.8 高出 10.2 個百分點,蛋白質相關任務高 7.7 個百分點。多家早期測試企業的回報也指向同一個方向:Opus 5 在長時間、多步驟的 agentic 任務上比前代更穩定,更能「檢查自己的答案」——會主動開瀏覽器確認頁面渲染結果、抓到自己漏掉的 edge case。

安全面的故事比較複雜。Anthropic 說 Opus 5 是他們「最安全的模型」,在自動化行為審計上整體偏差行為分數只有 2.3——低於 Opus 4.8、Sonnet 5、和 Fable 5。但同時,Opus 5 的資安分類器干預頻率比 Fable 5 低了約 85%。Anthropic 的解釋是 Opus 5 沒有被刻意訓練資安能力(跟 Mythos 5 不同),所以不需要那麼多分類器攔截。但換個角度:一個在多項 benchmark 上更強的模型,資安分類器卻攔得更少——這要嘛是分類器設計更精準了,要嘛是模型本身在刻意繞過分類器的意圖上更「乖」了。Anthropic 沒有提供足夠的資料讓外界判斷是哪一種。

另一個值得注意的細節:Cyber Verification Program(CVP)的會員可以拿到「安全限制較少」的 Opus 5 版本。誰能進 CVP?Anthropic 的審查標準是什麼?公告沒有提。再加上 API 新增的「自動 fallback」功能——被安全分類器攔下的請求可以自動轉到另一個模型,而不是直接拒絕——整體方向是讓安全機制變得更「彈性」。對企業客戶來說這是方便,對外界來說這是透明度在倒退。

Opus 5 目前是 Claude Max 的預設模型、Claude Pro 上最強的模型。API 已上線,不需資料保留即可使用。


Oracle 禁止 AI 程式碼進入 OpenJDK——但 Ellison 說 Oracle 自己的程式都是 AI 寫的

Oracle 上週對 OpenJDK 貢獻者發布新政策:AI 生成的程式碼不得提交到 OpenJDK 儲存庫、pull request、或任何專案管道。理由是安全、資安、和智慧財產權風險。開發者仍然可以用 LLM 輔助除錯和 code review,但最終提交的程式碼不能是 AI 寫的。

這個政策的矛盾點不在政策本身——開源專案對 AI 程式碼的態度確實需要討論——而在 Oracle 內部的雙重標準。Oracle 共同創辦人 Larry Ellison 最近才公開說「AI 模型現在在幫 Oracle 寫程式」,共同 CEO Mike Sicilia 也把工程團隊縮編歸功於 AI 工具帶來的效率提升。同一家公司:對外說 AI 寫的程式碼不安全不能進開源專案,對內說我們的程式碼都靠 AI 在寫。

更宏觀的脈絡:Oracle 今年要砸 700 億美元擴建資料中心,信用評等機構 S&P 因此把 Oracle 的評級降到 BBB-——只差一級就是垃圾級,理由是「投資回報不確定」。Oracle 正在把整間公司的未來押在 AI 基礎設施上,但對於 AI 產出的程式碼進入它主導的開源專案,卻畫了一條線。這條線畫在哪裡?畫在 Oracle 控制不到的地方。


DeepSeek V4 Flash 在 ARC-AGI 上跑到 89%,每題成本 $0.02

DeepSeek 在 ARC Prize 的 verified leaderboard 上提交了 V4 Flash 0731 的成績:ARC-AGI-1 Semi-Private 拿到 89.0%,ARC-AGI-2 Semi-Private 拿到 61.4%。三個推理等級(Max/High/Low)的成績都已驗證,模型權重放在 HuggingFace 上。

成本值得單獨拿出來說:ARC-AGI-1 每題 $0.02,ARC-AGI-2 每題 $0.04。對比 Anthropic 和 OpenAI 的 frontier 模型動輒 $15-25/M output tokens 的定價,這個成本差距不是幾成,是兩個數量級。

ARC-AGI-2 的 61.4% 不算碾壓——這還是一個多數模型都卡住的 benchmark——但方向是對的:中國開源模型用極低的成本,在抽象推理的指標上持續追近。DeepSeek 的技術報告(arXiv:2606.19348)說明了 inference-time scaling 策略,不單純是靠 brute force。


Cloudflare Kitesurf:一個專為 AI agent 設計的瀏覽器,跑在 V8 isolate 裡

Cloudflare 在 Agents Week 上發表了 Kitesurf——一個「agent-first」的瀏覽器。它跟傳統瀏覽器最根本的差別:它不是 Chromium,而是用 Rust 寫成、編譯成 WebAssembly、跑在 Cloudflare Workers 的 V8 isolate 裡。

技術選擇背後是明確的取捨。Kitesurf 是「ephemeral, fully-isolated, stateless engine」——只存在於一個任務的期間,任務結束就銷毀。它能過 215,000+ WPT 測試,能渲染 TodoMVC、Wikipedia、Hacker News、Cloudflare 自家部落格。但它不能播影片、不能跑 WebGL、不能處理需要持久 session 的認證流程、bot challenge 過不了。Cloudflare 自己得說法是:「如果你需要的是 pixel-perfect 的 Chromium,用 Browser Run 的預設版本就好。Kitesurf 是給那些寧可放棄一些相容性、換取速度和隔離性的 agent 用的。」

Kitesurf 支援 CDP(Chrome DevTools Protocol),可以直接接 Claude Code 或其他 MCP client,讓 agent 控制瀏覽器行為。Cloudflare 還做了一個公開的 playground,內嵌 Chrome DevTools,可以看到每個 isolate 的 WebAssembly 記憶體使用量。

值得注意:這個專案才 12 週,第一筆 commit 是今年五月。Cloudflare 說計畫開源,但目前還沒有。開源的承諾跟執行之間的距離,是 Cloudflare 最近幾次產品發表的一個重複模式——Cloudflare OS 也是「程式碼開源、基礎設施封閉」。


📡 其他值得關注

  • Mistral Shieldstral:3B 開源安全分類器,打敗大 7 倍的模型:Mistral 發布 Shieldstral,一套 3B 參數的開源多模態安全分類器(Apache 2.0)。核心設計:安全政策用自然語言寫在 inference 階段輸入,模型輸出單一 token 的 yes/no——不用重訓就能切換安全標準。文字安全指標上追平甚至超過 7 倍大小的同類模型,多模態安全(文字+圖片)拿下新的 SOTA。Mistral 是 NVIDIA 主導的 Open Secure AI Alliance 創始成員。→ Mistral AI