今天的 AI 圈只有一件真正的大事:Anthropic 發表了 Claude Opus 5。但環繞這件大事的,是一組微妙的重疊訊號——DeepSeek 同一時間更新了 V4 Flash、一個 150 年的物理猜想被 GPT-5.6 Sol 一句話推翻、一家新創公開說「我們砍掉了自家的 LLM router,因為它不值得」。三件事看似無關,卻都指向同一個核心問題:當模型愈來愈會「自己做判斷」,人類該把多少信任交出去?


🔥 Claude Opus 5:Fable 5 的九成效能、半價,主打「會自己驗證自己」

Anthropic 正式發表了 Claude Opus 5,即日起在所有平台上線。定價與 Opus 4.8 相同:每百萬輸入 token $5、輸出 $25。定位很清楚——「最接近 Fable 5 的日常使用模型,但價格只要一半。」

效能面,Anthropic 給出的圖表顯示 Opus 5 在 Frontier-Bench v0.1 上超過所有模型(含 Fable 5),CursorBench 3.2 在 max effort 下與 Fable 5 差距不到 0.5%,但每次任務成本砍半。在 ARC-AGI 3(新問題解決能力)上,Opus 5 的分數是第二名模型的三倍。Zapier AutomationBench 上,最低 effort 設定就比其他模型最高分還高。

但整篇公告最值得讀的不是 benchmark 表格,而是 Anthropic 用了一大段寫 Opus 5 的「行為特質」:它會自己寫電腦視覺 pipeline 來讀圖(因為題目故意不讓它直接看圖)、它會抓到開源套件的真實 root cause 而非表面修補、它會在工程師堅持錯誤設計時「推回去」。Anthropic 引用了多個早期使用者的回饋來強化這個敘事——Opux 5 不只更聰明,更「可靠」。其中一段來自某個使用者的原話:「Opus 5 對我的設計提出異議,在我堅持時沒有屈服,而是解釋了我想法中哪部分是對的、哪部分有問題,然後提出一個保留優點、修正缺陷的折衷方案。」

安全面的處理方式與 Opus 4.8 類似,但有一處值得標記。Anthropic 說 Opus 5 的資安分類器(cyber classifiers)比 Fable 5 寬鬆——預計干預頻率減少約 85%——允許在原始碼中找漏洞,但封鎖 binary-based 掃描、滲透測試和 exploit 生成。被封鎖的請求會 fallback 到 Opus 4.8。企業和研究機構可以透過 Cyber Verification Program(CVP)取得限制更少的版本。換句話說:你能做什麼,取決於 Anthropic 有沒有把你放進白名單。這個白名單的審核標準和流程,公告中沒有說明。

生物安全方面,Opus 5 現在是 Anthropic「能力最強的一般可用研究模型」,但仍落後 Mythos 5。生物相關請求在 Fable 5 上被封鎖的,會路由到 Opus 5 而非 Opus 4.8。

另外兩個 beta 功能一起推出:對話中途更換工具而不 invalidate prompt cache;API 層級的自動 fallback——安全分類器拒絕的請求可以自動路由到備用模型。


DeepSeek V4 Flash 更新:公開測試版上線,coding agent 跑分曝光

DeepSeek 在 7 月 31 日推送了 V4 Flash 的公開測試版 API。呼叫方式不變,model name 設為 deepseek-v4-flash 即可。

官方釋出的 benchmark 數據(使用 DeepSeek Harness minimal mode、max effort、topp=0.95、temperature=1.0):Terminal Bench 2.1 拿下 82.7、NL2Repo 54.2、Cybergym 76.7、DeepSWE 54.4、Toolathlon verified 70.3。內部的 DSBench-FullStack(全端開發)68.7、DSBench-Hard(coding agent 難題)59.6。

Artificial Analysis 的獨立評測將 V4 Flash 放在「開源模型中上水準」的位置:品質指數(Intelligence Index)50 分,同級開源模型中位數是 25。定價極具競爭力:每百萬輸入 token $0.14、輸出 $0.28——以這個價格帶來說,性價比很難挑剔。不過 AA 也標注了一個數據:模型在評測過程中產生了 210M token,屬於「非常 verbose」的等級。實際使用時的 token 消耗量值得留意。


150 年的 Maxwell 猜想被推翻——GPT-5.6 Sol 給了靈感,人類驗證了數學

一篇上傳到 arXiv 的論文宣告:James Clerk Maxwell 在 1873 年提出的靜電猜想是錯的。

Maxwell 猜想的内容是:n 個點電荷產生的靜電場,最多只有 (n−1)² 個非簡併臨界點。這個猜想在 n=2 時顯然成立,n=3 時至今沒人能證明或推翻(等量電荷除外)。

這篇論文找到了一組 5 個點電荷的配置——三個單位正電荷放在正三角形頂點,兩個微小電荷沿對稱軸拉開——產生了至少 24 個非簡併臨界點。而 Maxwell 猜想的上限是 (5−1)² = 16。24 > 16,猜想被證偽。

論文在「工具與計算資源揭露」段落寫了一段值得全文引用的話:「這個構造的想法由一個 LLM(OpenAI 的 GPT-5.6 Sol)提出。作者驗證了數學細節,並用自己的語言寫成論證。」換句話說:點子是 AI 給的,數學是人類確認的。電腦代數軟體(Mathematica、Maple)用來驗證計算和產生視覺化圖表。

這件事的結構不是「AI 取代了數學家」,而是「AI 提供了一個人類沒想過的幾何構造,然後人類把證明做出來」。論文作者是 Matthew D. Kvalheim(UMBC),受美國空軍科學研究辦公室資助。這不是大 lab 的產物,也沒有驚人的算力需求——只是一個 LLM 的靈感加上古典電磁學的解析推導。


Manifest 砍掉自家 LLM router:「大多數情況下,用一顆模型就好」

LLM router——根據請求複雜度自動選擇不同模型的閘道層——是近幾個月的熱門賽道。Manifest 在今年三月推出了自家的 router,六月決定標記為 deprecated,九月一日正式關閉。他們在部落格上詳細說明了為什麼。

Manifest 的 router 將請求分成四個難度層級(simple、standard、complex、reasoning),目標是降成本——簡單任務何必呼叫貴的模型?

四個月的使用數據(7,000 個雲端使用者)讓他們得出相反的結論。第一個問題:prompt 本身不包含任務的全貌。「幫我評估 repo $GIT_REPO 的測試並改進」——如果 repo 是純 HTML5 個人網站,這很簡單;如果是 Linux kernel,這是另一個世界。複雜度在 prompt 發出時根本無法判斷,要等到 tool call 和 web search 開始之後才知道。

第二個問題:cache 比 routing 更有效。prefix cache 命中時的費用只有原始輸入的 10%–25%。一個 cache-aware 的 router 會傾向「黏住」最初選的模型,等於 router 的效果被 cache 抵銷了。

第三個問題:行為一致性。Manifest 的立場是「工程師應該理解不同模型的 trade-off,就像畫家知道該用哪支筆」。在不同模型之間跳來跳去,拉低了整體工作品質,也讓工程師更難掌握自己的工具。

他們的結論沒有完全否定 LLM routing 的價值,但說得很直:在他們看到的大多數場景中,省下的錢會在別的地方被花掉,而且那個成本更難估算。


📡 其他值得關注

  • SWE-rebench:13 顆模型 + 4 個 agent 在跨語言 SWE 任務上的表現對比(Go、Java、Python、Rust、TypeScript),含 GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.6 等新模型。→ swe-rebench.com

  • Marble OS:Show HN —「AI agent 的 GUI 應該長什麼樣子?」一個互動式 demo,展示 agent 操作介面的設計探索。→ marbleos.com

  • Orca-Bench:arXiv 論文探討語言模型 agent 是否準備好接 oncall——評估 agent 在生產事件回應中的診斷與修復能力。→ arXiv

  • Predictive Speculative KV Replication:一篇技術文章探討如何用預測性 KV cache 複製來處理 bursty LLM 推論場景,降低冷啟動延遲。→ jwlabs.vercel.app