【LLM 日報】2026 年 08 月 13 日 — xAI 的 Grok 4.6 打進前沿、Qwen 開源 2.4T MoE、DeepSeek 靜悄悄發了 V4 Pro
今天有三個模型發布,但方式截然不同:xAI 的 Grok 4.6 大張旗鼓宣布「回到前沿」,Qwen 開源了一個 2.4T 參數的 MoE 模型,DeepSeek 則在沒有任何官方公告的情況下把 V4 Pro 0813 丟上 OpenRouter。三家公司的發布策略,反映了他們對市場定位的不同理解。
🔥 xAI 的 Grok 4.6:AA Intelligence Index 61,定價 $2/$6,每任務成本 $0.84
xAI 發布了 Grok 4.6,在 Artificial Analysis Intelligence Index(九項 benchmark 的綜合分數)上拿到 61 分,和 GPT-5.6 Sol 並列,低於 Claude Opus 5 的 63 和 Claude Fable 5 的 62。這是 SpaceXAI 自 Grok 4.3 以來首次回到前沿——比一個月前發布的 Grok 4.5 高出 5 分。
但 Grok 4.6 的亮點不在於它追上了誰,而在於它的成本結構。定價維持 $2/$6 per 1M tokens(輸入/輸出),比 Claude Opus 5 的 $5/$25 和 GPT-5.6 Sol 的 $5/$30 便宜 60% 以上。Artificial Analysis 測得的每任務成本是 $0.84,和 Kimi K3 相當,但 Intelligence Index 分數略高。這讓 Grok 4.6 落在成本效益的 Pareto 前沿上。
在 agentic work(多步驟、需要工具使用、長時間執行的任務)上,Grok 4.6 的表現特別突出。GDPVal-AA v2 Elo 1753,僅次於 Claude Opus 5,和 Claude Fable 5、Qwen3.8 Max 的置信區間重疊。Terminal-Bench v2.1(終端機操作的軟體工程任務)拿到 88.4%,和領先模型並列。AA-Briefcase(長時間 agentic knowledge work 的私有 benchmark)Elo 1577,和 Fable 5 同級,但完成任務只需要約 53 輪對話和 0.5B input tokens——Claude Opus 5 需要 103 輪和 2.0B tokens。
Context window 維持 500K tokens(和 Grok 4.5 相同)。Cache hit 價格從 $0.3 漲到 $0.5 per 1M tokens。
Grok 4.6 今天在 Cursor 和 Grok Build 上可用,API 也開放,OpenRouter、Vercel、Cloudflare 等合作夥伴同步上線。xAI 提供第一週 2 倍的 included usage。
Qwen3.8-2.4T-A95B:2.4T 參數、95B 激活、512 個 Experts、開源
阿里 Qwen 團隊發布了 Qwen3.8-2.4T-A95B,這是 Qwen 系列第一個 MoE 模型,也是目前開源的最大規模模型之一。總參數 2.4T,每次推理激活 95B。架構細節:512 個 experts,每次路由 10 個 + 1 個 shared expert;92 層;混合了 Gated DeltaNet(linear attention)和 Gated Attention;原生支持 262K context,可擴展到 1,010K。
License 不是 Apache 2.0,而是 qwen3.8-max(自訂授權)。Model card 沒有說明這個授權的具體條款,只提供了指向 LICENSE 檔案的連結。
Qwen 團隊在 model card 中列出了大量 benchmark 數據,對標 Claude Opus 4.8、Fable 5、GPT 5.6 Sol、Qwen3.7-Max。以下是部分結果:
| Benchmark | Opus 4.8 | Fable 5 | GPT 5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 75.1 |
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
Qwen3.8-Max 在 PaperBench(93.0)上超過所有閉源模型,在 Terminal Bench 2.1(86.6)上接近 GPT 5.6 Sol(88.8),但在 SWE-bench Pro(67.7)上落後 Fable 5(80.0)和 Opus 4.8(69.2)。
值得注意的是:model card 中的 benchmark 是 Qwen3.8-Max(官方 API 版本,基於 Qwen3.8-2.4T-A95B 但加了視覺輸入、non-thinking support、1M context、內建工具等功能),不是開源權重本身。開源版本和 API 版本的效能差距沒有說明。
Qwen 團隊提到 Qwen3.8 支持 reasoning_effort 參數控制推理深度,以及 preserve_thinking 參數保留歷史訊息中的推理上下文。這些功能和 OpenAI 的 reasoning_effort 類似。
- 來源:HuggingFace
DeepSeek V4 Pro 0813:沒有公告、沒有 blog post、只有 OpenRouter 頁面
DeepSeek 在 8 月 12 日把 V4 Pro 0813 丟上 OpenRouter,但沒有任何官方公告、blog post、或 system card。OpenRouter 頁面寫著「DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.」
規格:1M context window,定價 $0.435/$0.87 per 1M tokens(輸入/輸出)。支持 tool calling 和 structured outputs。
DeepSeek 的 API 文件(api-docs.deepseek.com)有 Responses API 的頁面,但沒有 V4 Pro 0813 的具體說明。沒有 benchmark 數據、沒有 system card、沒有安全評估報告。
這種「quiet release」策略在開源模型社群中常見(丟上 GitHub、不寫 README),但在前沿模型中少見。OpenAI、Anthropic、Google、xAI 都會配合 blog post、system card、媒體對接。DeepSeek 選擇不說話,讓用戶自己從 OpenRouter 頁面和 API 文件中拼湊資訊。
- 來源:OpenRouter
📡 其他值得關注
-
有人偽裝 ClaudeBot 進行大規模漏洞掃描:Known Agents 的 Agentic Web Index 報告指出,有人偽裝成 ClaudeBot(Anthropic 的爬蟲)進行 vulnerability scanning。報告顯示,bot traffic 佔整體網站流量的 35%,其中 AI-related traffic 佔 29%。ClaudeBot 在所有 visiting agents 中排第 6(3.2%),ChatGPT-User 排第 5(3.3%)。→ Known Agents
-
Tim Gowers(菲爾茲獎得主)寫了一篇「LLM 擅長什麼數學?」:Gowers 在部落格上討論 LLM 在數學任務上的能力邊界。他認為 LLM 在「需要大量記憶的數學」(例如特殊函數的性質)上表現好,但在「需要創造性推理的數學」(例如證明新定理)上仍然弱。→ Gowers’ Blog
-
德國倡議團體對 Meta AI 眼鏡提起刑事告訴:理由是隱私侵害,指控 Meta 在未經同意的情況下收集個資。Reuters 報導,Meta 沒有回應。→ Reuters
-
Gemini API Managed Agents 更新:3.6 Flash、hooks、更多功能:Google 宣布 Gemini API 的 Managed Agents 新增 3.6 Flash 支持、hooks 機制、以及其他生產就緒功能。→ Google Blog
-
OpenAI 致信德州州長 Greg Abbott,承諾「負責任的 AI 基礎建設」:信中說明 OpenAI 在德州建設 AI 基礎設施的承諾,但沒有具體措施。→ OpenAI