【LLM 日報】2026 年 08 月 28 日 — 旗艦降價、晶片入場、開源追價
上一期(08-22)到現在這六天,LLM 圈的主角不是誰把跑分刷到頂,而是把同樣的智慧賣得更便宜、算得更省。Anthropic 兩天內把 Sonnet 和 Opus 都推進到下一代,一個降價下放、一個號稱半價貼近前沿;OpenAI 公布自家第一顆推理晶片,把效能單位從「每秒 token」換成「每瓦 AI 工作量」;Qwen 則用開源 MoE 把價格打到另一個量級。能力在往下放,成本也在往下壓——但這些數字,多半是各家自己量的。
🔥 Claude Opus 5:半價號稱貼近前沿,但資安那道分界線還握在官方手裡
Anthropic 於 8 月 27 日推出 Claude Opus 5,官方定位是「在 Fable 5 前沿智慧約一半的價格上,接近前沿」。官方說法在 Frontier-Bench、GDPval-AA 等評估上取得新 SOTA,但在資安類任務仍落在 Mythos 5 之後。它引入 effort 設定(低/標準/高),讓使用者拿 token 換智慧,並在與前代 Opus 4.8 相同價格下提升性能——Anthropic 宣稱在生命科學評估上全面勝過 4.8,其中有機化學分子結構判讀 +10.2 個百分點、蛋白質功能預測 +7.7 個百分點。新模型是 Claude Max 的預設模型、Claude Pro 上最強的一顆。
值得放大的幾件事。第一,所有分數都是 Anthropic 自己的評估框架,「半價貼近前沿」也是它自己定義的價位。第二,Opus 5 不是這週才出現——8 月中那篇蛋白質設計論文裡,拿去判讀 NMR 與 LC-MS 原始資料的就是它,Anthropic 當時沒明講它叫 Opus 5。第三,資安能力仍低於 Mythos 5,而受限存取(trusted access)的分界線就畫在那裡——誰能碰到資安最強的那顆、誰只能拿降級的這顆,判準與放行的門都由同一家公司把著。
Claude Sonnet 5:把 agent 能力下放到預設層
Sonnet 5 於 8 月 26 日發布,官方定位是「最 agentic 的 Sonnet」,全平台預設——Free 與 Pro 的預設模型,Max、Team、Enterprise 也都能用。定價每百萬 token 輸入 2 美元、輸出 10 美元,此前標為「引進價」,官方這次說已轉為永久價格。官方說法:相比 4.6,在推理、工具使用、程式碼與知識工作上明顯進步,agent 任務表現「接近 Opus 4.8」但價格更低;配合 effort 設定,高 effort 下部分任務可追上 Opus 4.8。
安全評估方面,Anthropic 說 Sonnet 5 整體不良行為比例低於 4.6,而且資安相關能力「遠低於現行的 Opus 模型」——這個低下被官方直接當成賣點寫出來。前段的 Opus 5 資安能力中段,這段的 Sonnet 5 資安能力偏低,分類、定價、誰能拿哪顆,全部由同一家公司一張表格決定;「接近 Opus 4.8」仍是自家評估,外部尚未有獨立復現。
OpenAI Jalapeño:第一顆自家推理晶片,效能單位換成「每瓦」
OpenAI 首次公布客製推理晶片 Jalapeño 的實測結果。測量跑在 SemiAnalysis 的公開 benchmark InferenceX 上,對照三顆公開模型 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T:官方數字是每瓦 AI 工作量最高提高 1.5–1.9 倍、端到端延遲降低 1.7–3.6 倍、重度互動工作負載性能高 2.1–4.1 倍。晶片額定 700 瓦,官方說在所測工作負載上實際持續功耗維持在 550 瓦以下。官方敘事:單一架構同時拿下 throughput 與 latency,取代以往兩者互斥的取捨——但前提是測量來自 OpenAI 自己、對照的「系統」也由 OpenAI 挑選,只有基準本身是第三方(SemiAnalysis)的。
把時間軸拉回上一期開頭那筆帳:OpenAI 第二季營收成長放緩、虧損擴大到 123 億美元。一家虧損擴大的公司垂直整合到自己做矽,理由官方說是要「讓 AI 更便宜普及」。省下來的算力成本最後結算進誰的報表——是削減到用戶帳單,還是只降低自家的邊際成本,官方的說法是前者,原始財務數字沒有公開。
- 來源:openai.com
Qwen3.8-Flash-Next:開源 MoE,價格打到另一個量級
Qwen 團隊於 8 月 26 日發布開源模型 Qwen3.8-Flash-Next:主模型參數 125B、單次激活僅 6B,另含 51B 的 n-gram embedding,原生支援 100 萬 token 上下文。權重在 Hugging Face 與 ModelScope 開放,技術報告公開在 GitHub。生產版 Qwen3.8-Flash 透過千問AI平台提供,每百萬 token 輸入 0.8 元人民幣、輸出 2.7 元——價價格落在截然不同的量級。
架構上採用 Gated DeltaNet + Qwen Sparse Attention(QSA)的 hybrid、Gated Residual、N-gram embedding 與 Muon optimizer,官方定位是「極致性價比」。分數方面,Qwen 自己的 table 宣稱在 DeepSWE 1.1、SWE-bench Pro、CoWorkBench、JobBench、Toolathlon 等 coding 與 agent 評估上超過 Claude-Opus-4.6 (Max),部分項目是壓倒性差距。要標注:這些是 Qwen 自己量測的成績,採用 Claude Code 與自家 harness 當評估框架,未有第三方獨立復現;開源的是權重與報告,正式 API 與工具走自家平台。
- 來源:qwen.ai
📡 其他值得關注
-
Gemini Omni 1.1 Flash:Google 發布新一代 omni 模型,官方說法是給開發者「更多控制」——另一篇則是 Gemini-3.5-Transcribe,主打轉錄。→ blog.google
-
Anthropic 多智能體研究:協調有效,但共謀也更可怕:Frontier Red Team 的實驗中,45 個 agent 共享論壇協調找漏洞,Mythos Preview 在 27M token 下找到 266 個漏洞、平行個別跑只找到 21 個;但同一篇也展示 agent 同質化——18 個 agent 開出同一個 git branch 名「mvp-game-loop」、五成以上都去寫 ray tracer 或 self-hosting compiler。協調越有效,單一壞決策被複製成系統性失誤的風險就越高。→ anthropic.com
-
OpenAI 教育研究:ChatGPT 提升品質,因果推理訓練提升原創性:Bocconi 與 OpenAI 經濟研究團隊的隨機實驗,超過 1000 名學生——有 ChatGPT 的組作業品質與連貫性較好,多上一堂因果推理課的組產出更多獨特想法,兩者都有則兩項都得分。研究由 OpenAI 協作並發布。→ openai.com
-
Mistral 主權 AI 與在地推論:Mistral 發布在歐洲的 region 內推論、開放模型與在地基礎設施,官方說法是「主權 AI」;另宣布 Mistral x HUMAIN 合作。→ mistral.ai