今天的 LLM 圈有三個方向同時在跑:Google 把 Flash 系列的價格再砍一半、OpenAI 和 Cerebras 合作把前沿模型的推理速度拉到 750 tokens/sec、DeepSeek 一方面開源了 agent harness,一方面把 API 價格調漲到最高 10 倍。三件事的共同點:定價策略正在成為模型戰爭的主戰場,技術差異化逐漸讓位於商業模式差異化。


🔥 Google 推出 Gemini 3.7 Flash:Intro pricing $0.75/$3.75,半價賣到年底

Google 發布 Gemini 3.7 Flash,在 Gemini 3.6 Flash 推出僅三週後。新模型在 FrontierCode 1.1 上拿到 43.6%(vs 3.6 Flash 的 34.4%)、DeepSWE v1.1 上 65.3%(vs 48.6%)、WebDev Arena Elo 從 1538 提升到 1588。Artificial Analysis Intelligence Index 得分 56,介於 Claude Sonnet 5(55)和 GPT-5.6 Terra(57)之間。

價格方面:每百萬 input token $0.75、output token $3.75——這是 Gemini 3.6 Flash 原價的一半。但這有個明確期限:intro pricing 只到 2026 年 12 月 31 日。2027 年 1 月 1 日起,價格回到 $1.50/$7.50。

支援 text、image、audio、video 輸入,1M context window,最大 64K output tokens。今天已在 Gemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterprise 上線,AI Pro 和 Ultra 訂閱者可用 Gemini Spark agent。

背景:OpenAI 上週把 GPT-5.6 Luna 降價 80%、xAI 推出定價僅為 Claude Opus 5 四分之一的 Grok 4.6。Google 這次的 intro pricing 是回應這個環境。值得注意的是 intro pricing 有明確截止日——2027 年 1 月 1 日之後價格翻倍。


OpenAI + Cerebras 推出 Ultrafast mode:GPT-5.6 Sol 跑到 750 tokens/sec

OpenAI 和 Cerebras 聯合發布 Ultrafast mode,一個新的 API service tier。GPT-5.6 Sol 在 Ultrafast 模式下每秒最多輸出 750 tokens,官方說法是比 Standard 快 14 倍,比 Fable 5 快 11 倍,比 Opus 4.8 Fast mode 快 5 倍(Artificial Analysis 數據)。

Cerebras 的測試數據:在 Humanity’s Last Exam(2,500 題博士級問題)上,GPT-5.6 Sol Ultrafast 用 11 小時 11 分跑完全部題目,Claude Fable 5 需要 78 小時 27 分。在 GDP-Val(經濟有價值的知識工作 benchmark)上,Ultrafast 的端到端加速是 5.6 倍,官方說法是「without quality degradation」。

技術基礎是 Cerebras 的 Wafer-Scale Engine,每片晶片封裝 44 GB SRAM,權重留在 on-chip,token 穿過跨晶片 pipelined layers 不中斷。

限制條件:Ultrafast 目前是 limited preview,只對 select group of customers 開放。官方沒有公布定價,只說「access will expand as capacity grows」。早期客戶包括 Jane Street、Podium、Basis、Rogo。

這是 Cerebras 繼 Groq 之後第二家在專用硬體上跑前沿模型推理的公司。兩家策略不同:Groq 和多模型商合作,Cerebras 目前深度綁定 OpenAI——Ultrafast 只跑 GPT-5.6 Sol,沒有其他模型選項。


DeepSeek Harness:MIT 授權的 agent harness,「everything is a plugin」

DeepSeek 在 GitHub 上發布 DeepSeek Harness developer preview,一個開源的 agent harness 框架,MIT 授權。核心設計原則是「everything is a plugin」——models、tools、skills、sessions、sandboxes、storage、loops、scheduling、UI 都是可替換的 plugin,基於 Cordis kernel 的 plugin system。

四種 runtime mode:

  • Standard:完整 toolset(file editing、shell、web search、skills、planning、subagents)
  • Code:用模型生成的 TypeScript 程式碼編排多輪 tool calls
  • Minimal:只有 shell tool 和 str_replace_editor,用於 benchmarking
  • Creator:runtime inspection、plugin experiments、preset authoring

每個 run 的所有輸入都記錄在 append-only session log 中,包括 system prompts、reasoning、tool calls、subagent scheduling。Trajectory view 可以按 source 檢視這些記錄,支援 resume、fork、search、replay。

同一時間,DeepSeek 宣布 API 定價調整(8 月 16 日 16:00 UTC 生效),引入 peak 和 off-peak 費率。社群反應:多位使用者指出漲幅可達 10 倍,尤其影響亞洲時區的使用者(peak 時段正好是亞洲工作時間)。一位使用者寫道:「It was fun while it lasted. There isn’t really a reason to use DeepSeek anymore.」另一位質疑:「Why do you subsidize US and EU and increase price for everyone near ASIAN time zone?」

兩個消息放在一起看:DeepSeek 一方面開源了 agent harness(讓開發者可以自建、自管、自部署),一方面把 API 價格調漲到讓部分開發者考慮離開。這兩個動作的受眾是不同的——前者吸引基礎設施層的合作者和貢獻者,後者影響的是直接用 API 的終端開發者。


Anthropic 推出 Conceptual Reasoning Index:衡量模型在哲學、決策理論、AI 風險上的推理能力

Anthropic Alignment Science 團隊發布 Conceptual Reasoning Index(CRI),一個聚合三個 benchmark 的綜合指標,用來衡量模型在「概念推理」上的能力——這裡的概念推理指的是沒有明確 ground truth、無法用經驗證據驗證、需要依賴論證的任務。

三個子 benchmark:

  • LMCA(Language Model Conceptual Argumentation):560 個立場文本、1,461 個反對論點,由專家評分。衡量模型判斷論點品質的能力。佔 CRI 60%。
  • ACCoRD(Assessment of Consistency in Conceptual Reasoning Domains):567 個邏輯一致性約束,衡量模型在概念問題上的自我一致性。佔 CRI 20%。
  • DTBench capabilities(Decision Theory Benchmark):407 個手寫選擇題,涉及決策理論、對模型自身行為的預測。佔 CRI 20%。

最高分是 Opus 5(73.6,95% CI ±2.1),其次是 Claude Fable 5、Muse Spark 1.2。CRI 的估計上限是 91——意思是即使模型完美複製專家的論點評分、完全邏輯一致、答對所有 DTBench 題目,也只能拿到 91。DTBench 已接近飽和(Fable 5 答對 98%),LMCA 預估一年內會開始飽和,ACCoRD 的飽和時間不確定。

一個結構性的細節:CRI 衡量的是模型在「AI 安全研究者需要的推理類型」上的表現。Anthropic 的立場文件寫得很清楚——「a major determinant of whether we address AI risks in time is how early we can automate or uplift this work」。這等於說:CRI 不只是在衡量模型的通用能力,它在衡量模型能不能幫 Anthropic 做 Anthropic 想做的事。


📡 其他值得關注

  • Samsung 用 Claude 驗證晶片設計,過程不順利:Neowin 報導 Samsung 正在用 Claude 做 chip design verification,但過程「not going smoothly」。沒有具體細節,但半導體設計驗證是一個高度專業、容錯率極低的領域,LLM 在其中的應用還需要大量調整。→ Neowin

  • Mistral OCR 4.1 發布:Mistral 推出 OCR 4.1 模型。→ docs.mistral.ai

  • Mistral 宣布歐洲區域推理基礎設施:官方說法是「sovereign AI」,把 inference infrastructure、open models、long-term commitments 帶到歐洲。→ Mistral

  • OpenAI 發布 GPT-5.6 builder’s guide:說明 startups 如何使用 GPT-5.6。→ OpenAI