今天有三個模型發布,但方式截然不同:xAI 的 Grok 4.6 大張旗鼓宣布「回到前沿」,Qwen 開源了一個 2.4T 參數的 MoE 模型,DeepSeek 則在沒有任何官方公告的情況下把 V4 Pro 0813 丟上 OpenRouter。三家公司的發布策略,反映了他們對市場定位的不同理解。


🔥 xAI 的 Grok 4.6:AA Intelligence Index 61,定價 $2/$6,每任務成本 $0.84

xAI 發布了 Grok 4.6,在 Artificial Analysis Intelligence Index(九項 benchmark 的綜合分數)上拿到 61 分,和 GPT-5.6 Sol 並列,低於 Claude Opus 5 的 63 和 Claude Fable 5 的 62。這是 SpaceXAI 自 Grok 4.3 以來首次回到前沿——比一個月前發布的 Grok 4.5 高出 5 分。

但 Grok 4.6 的亮點不在於它追上了誰,而在於它的成本結構。定價維持 $2/$6 per 1M tokens(輸入/輸出),比 Claude Opus 5 的 $5/$25 和 GPT-5.6 Sol 的 $5/$30 便宜 60% 以上。Artificial Analysis 測得的每任務成本是 $0.84,和 Kimi K3 相當,但 Intelligence Index 分數略高。這讓 Grok 4.6 落在成本效益的 Pareto 前沿上。

在 agentic work(多步驟、需要工具使用、長時間執行的任務)上,Grok 4.6 的表現特別突出。GDPVal-AA v2 Elo 1753,僅次於 Claude Opus 5,和 Claude Fable 5、Qwen3.8 Max 的置信區間重疊。Terminal-Bench v2.1(終端機操作的軟體工程任務)拿到 88.4%,和領先模型並列。AA-Briefcase(長時間 agentic knowledge work 的私有 benchmark)Elo 1577,和 Fable 5 同級,但完成任務只需要約 53 輪對話和 0.5B input tokens——Claude Opus 5 需要 103 輪和 2.0B tokens。

Context window 維持 500K tokens(和 Grok 4.5 相同)。Cache hit 價格從 $0.3 漲到 $0.5 per 1M tokens。

Grok 4.6 今天在 Cursor 和 Grok Build 上可用,API 也開放,OpenRouter、Vercel、Cloudflare 等合作夥伴同步上線。xAI 提供第一週 2 倍的 included usage。


Qwen3.8-2.4T-A95B:2.4T 參數、95B 激活、512 個 Experts、開源

阿里 Qwen 團隊發布了 Qwen3.8-2.4T-A95B,這是 Qwen 系列第一個 MoE 模型,也是目前開源的最大規模模型之一。總參數 2.4T,每次推理激活 95B。架構細節:512 個 experts,每次路由 10 個 + 1 個 shared expert;92 層;混合了 Gated DeltaNet(linear attention)和 Gated Attention;原生支持 262K context,可擴展到 1,010K。

License 不是 Apache 2.0,而是 qwen3.8-max(自訂授權)。Model card 沒有說明這個授權的具體條款,只提供了指向 LICENSE 檔案的連結。

Qwen 團隊在 model card 中列出了大量 benchmark 數據,對標 Claude Opus 4.8、Fable 5、GPT 5.6 Sol、Qwen3.7-Max。以下是部分結果:

Benchmark Opus 4.8 Fable 5 GPT 5.6 Sol Qwen3.7-Max Qwen3.8-Max
Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro 69.2 80.0 64.6 60.6 67.7
DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6
PaperBench 80.3 88.8 90.5 64.8 93.0
AndroidBench 69.8 84.5 74.0 56.5 75.1
CoWorkBench 72.3 75.9 71.5 64.6 74.8

Qwen3.8-Max 在 PaperBench(93.0)上超過所有閉源模型,在 Terminal Bench 2.1(86.6)上接近 GPT 5.6 Sol(88.8),但在 SWE-bench Pro(67.7)上落後 Fable 5(80.0)和 Opus 4.8(69.2)。

值得注意的是:model card 中的 benchmark 是 Qwen3.8-Max(官方 API 版本,基於 Qwen3.8-2.4T-A95B 但加了視覺輸入、non-thinking support、1M context、內建工具等功能),不是開源權重本身。開源版本和 API 版本的效能差距沒有說明。

Qwen 團隊提到 Qwen3.8 支持 reasoning_effort 參數控制推理深度,以及 preserve_thinking 參數保留歷史訊息中的推理上下文。這些功能和 OpenAI 的 reasoning_effort 類似。


DeepSeek V4 Pro 0813:沒有公告、沒有 blog post、只有 OpenRouter 頁面

DeepSeek 在 8 月 12 日把 V4 Pro 0813 丟上 OpenRouter,但沒有任何官方公告、blog post、或 system card。OpenRouter 頁面寫著「DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.」

規格:1M context window,定價 $0.435/$0.87 per 1M tokens(輸入/輸出)。支持 tool calling 和 structured outputs。

DeepSeek 的 API 文件(api-docs.deepseek.com)有 Responses API 的頁面,但沒有 V4 Pro 0813 的具體說明。沒有 benchmark 數據、沒有 system card、沒有安全評估報告。

這種「quiet release」策略在開源模型社群中常見(丟上 GitHub、不寫 README),但在前沿模型中少見。OpenAI、Anthropic、Google、xAI 都會配合 blog post、system card、媒體對接。DeepSeek 選擇不說話,讓用戶自己從 OpenRouter 頁面和 API 文件中拼湊資訊。


📡 其他值得關注

  • 有人偽裝 ClaudeBot 進行大規模漏洞掃描:Known Agents 的 Agentic Web Index 報告指出,有人偽裝成 ClaudeBot(Anthropic 的爬蟲)進行 vulnerability scanning。報告顯示,bot traffic 佔整體網站流量的 35%,其中 AI-related traffic 佔 29%。ClaudeBot 在所有 visiting agents 中排第 6(3.2%),ChatGPT-User 排第 5(3.3%)。→ Known Agents

  • Tim Gowers(菲爾茲獎得主)寫了一篇「LLM 擅長什麼數學?」:Gowers 在部落格上討論 LLM 在數學任務上的能力邊界。他認為 LLM 在「需要大量記憶的數學」(例如特殊函數的性質)上表現好,但在「需要創造性推理的數學」(例如證明新定理)上仍然弱。→ Gowers’ Blog

  • 德國倡議團體對 Meta AI 眼鏡提起刑事告訴:理由是隱私侵害,指控 Meta 在未經同意的情況下收集個資。Reuters 報導,Meta 沒有回應。→ Reuters

  • Gemini API Managed Agents 更新:3.6 Flash、hooks、更多功能:Google 宣布 Gemini API 的 Managed Agents 新增 3.6 Flash 支持、hooks 機制、以及其他生產就緒功能。→ Google Blog

  • OpenAI 致信德州州長 Greg Abbott,承諾「負責任的 AI 基礎建設」:信中說明 OpenAI 在德州建設 AI 基礎設施的承諾,但沒有具體措施。→ OpenAI