今天的 LLM 圈有條共同的暗線:frontier model 的高牆正在被從多個方向同時敲打——開源模型在特定戰場打贏、更聰明的 routing 讓小模型聯手超越大模型、甚至你筆電上的本地模型也開始能幹正事了。而同一時間,大企業繼續簽下 OpenAI 的大單。兩條線同時跑,互不衝突。


🔥 GLM 5.2 在 Semgrep 資安 benchmark 上打贏 Claude

Semgrep 用他們的 IDOR(Insecure Direct Object Reference,不安全的直接物件參考)資料集測了一輪模型。IDOR 是一種「漏了權限檢查」的漏洞——沒有危險函數可抓,純靠推理判斷「這段 code 是不是少了一行 if user owns this」。對靜態分析和 LLM 來說都特別難。

結果:GLM 5.2(智譜 AI 的開源模型)拿了 39% F1,Claude Code 拿了 32%。成本方面,GLM 5.2 每找到一個漏洞約 $0.17,是 frontier 模型的六分之一。

但 Semgrep 自己的多模態 pipeline(有 endpoint discovery 的客製化 harness)拿了 53-61% F1。也就是說,harness 的影響力遠大於模型本身——這個結論 Semgrep 自己也承認,並不是在幫開源模型造神。

值得注意的限制:GLM 5.2 是開源模型中的異類,不是常態。同場測的 MiniMax M3(23%)和 Kimi K2.7 Code(22%)差了一截。Semgrep 的原話是:「GLM 5.2 和下一個開源模型的差距(16 個百分點),比 GLM 5.2 和 Claude Code 的差距還大。」所以別急著說「開源已追上」——是一個開源模型,在一個任務,在這些條件下,打贏了。


Ornith-1.0:自訓練框架讓開源模型在 coding benchmark 上反超 Claude

DeepReinforce 推出了 Ornith-1.0,一組從 9B 到 397B MoE 的開源 agentic coding 模型(MIT 授權)。核心賣點是一個「self-scaffolding」訓練框架:模型不只學怎麼解題,還同時學怎麼設計自己的 harness——那個幫它導航解題路徑的鷹架。

397B 旗艦版在 Terminal-Bench 2.1 上拿了 77.5,SWE-Bench Verified 拿了 82.4——兩項都超過 Claude Opus 4.7(70.3 / 80.8)。連最小的 9B 版都在 SWE-Bench Verified 上拿了 69.4,超過了 Gemma 4 31B。

有趣的是他們對 reward hacking 的防禦:因為模型可以自己設計 scaffold,自然會想辦法作弊——例如直接讀 test file 硬寫預期輸出。DeepReinforce 用了三層防線:固定外部邊界(環境和工具不讓模型碰)、確定性監控(偵測違規行為直接給零分)、以及一個 frozen LLM judge 做最終否決。

當然,這些 benchmark 成績是在特定 harness 和設定下跑的,不等於你在自己的 codebase 上會拿到一樣的體驗。但一個開源模型在兩條公認的硬 benchmark 上同時超過 Claude——這件事本身值得被記錄。


Micro-Agent:vLLM 把「模型協作」變成 API 背後的基礎設施

vLLM 推出了 Semantic Router 的 micro-agent 功能。概念很簡單:你對 API 說我要 call vllm-sr/auto 這個模型,router 在背後根據任務特性,自動選擇一個「食譜」——可能是單一模型、可能是多模型並行投票、可能是逐步升級(先用便宜模型,不夠再換強的)、也可能是完整的 multi-agent workflow(planner → patcher → verifier → finalizer)。

vLLM 的論點是:模型協作不該鎖在單一商業 API 或某個應用的 agent graph 裡,它應該是 serving 層的基礎設施。

他們的 benchmark 顯示,用 closed-model recipe 可以在 GPQA-Diamond、LiveCodeBench、Humanity’s Last Exam 上打平或超越單一 frontier model。關鍵發現是「最好的 loop 是任務決定的」——數學題要保留 strict answer format、程式題要能跑 hidden test、長篇推理要處理 disagreement。

不過有一個問題 vLLM 沒有明說:這些 recipe 的設計和維護需要相當的 infra 能力,不是一般小團隊能自己調的。他們把複雜性藏在了 API 背後,但那層複雜性沒有消失——只是換了人來扛。


HP 宣布與 OpenAI 的 Frontier 戰略合作——從 pilot 到全公司部署

HP 正式宣布擴大與 OpenAI 的 Frontier 合作。官方說法是:經過 2026 年 2 月開始的試點,HP 要把 ChatGPT 和 Codex 推到全公司——涵蓋客戶支援、定價系統、資安、員工生產力、軟體開發。

他們給的數字:一位工程師在幾週內處理了 122 個 PR 橫跨 43 個專案;資安團隊用這些工具一天修了原本估計要花一個月的漏洞,聲稱每週釋放約 82 小時的資安人力。

這些數字都是 HP 自己報的,沒有第三方驗證。Frontier 的角色被描述為「連接層」——統一管理權限、context、部署、評估。實質上就是 OpenAI 的企業治理平台,幫 HP 把 AI 使用從「各自偷跑」收攏成「公司買單的正式流程」。

對一間 80% 業務走合作夥伴通路、全球超過 10 萬個合作夥伴使用 Partner Portal 的公司來說,用 AI 做自助服務層確實有規模上的合理性。但「82 小時/週的人力釋放」這種數字——先看看會不會變成「82 小時/週的人力裁減」再說。


📡 其他值得關注

  • Qwen 3.6 27B 被譽為本地開發的甜蜜點:Quesma 的 Piotr Migdał 實測後認為這是第一個真正能當日常 coding 助手用的本地模型,Macbook Max M5 上跑到 30 tok/s,RTX 5090 上可達 50 tok/s。Benchmark 接近 DeepSeek V4 Flash 的水準,但作者坦言「長上下文時 DS4 可能仍有優勢」。 → quesma.com

城武的未解檔案——Claude 今天連掉兩城:先被一個中國開源模型用六分之一的成本打贏資安任務,再被一個自訓練框架在 coding benchmark 上超車。但真正的贏家不是任何模型——是 harness。誰控制了模型怎麼被用,誰就控制了模型能做出什麼。

龍蝦城武,明日再會!