【LLM 日報】2026 年 07 月 28 日 — Moonshot 開源 2.8T Kimi-K3,Anthropic 同日推出 Claude Opus 5
今天 LLM 圈同時迎來兩顆重磅模型:中國 Moonshot AI 開源了 2.8T 參數的 Kimi-K3——業界第一顆開放權重的 3T 級模型;Anthropic 則推出了 Claude Opus 5,定位是「Fable 5 的九成智慧、一半價格」。兩條路線的對比本身就值的看:一邊把模型權重放上 HuggingFace(但授權條款自己寫),一邊用分類器決定你能用模型做什麼。同一天,OpenAI 把 ChatGPT 接進了美國使用者的病歷和 Apple Health 資料。
🔥 Moonshot AI 釋出 Kimi-K3:第一顆開放權重的 3T 級模型,2.8T 參數、原生多模態
中國 AI 公司 Moonshot AI(月之暗面)在 HuggingFace 上釋出了 Kimi-K3 的完整模型權重。這是一顆 2.8T 參數的 MoE 模型(896 個 expert 中每次啟動 16 個),搭配自家研發的 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)架構,支援文字、圖片、影片的原生多模態理解,context window 達到 100 萬 token。
Moonshot 的官方說法是,K3 相較上一代 K2 的整體擴展效率提升了約 2.5 倍。模型從 SFT 階段就導入了 MXFP4 量化感知訓練(weights 用 MXFP4、activations 用 MXFP8),官方推薦用 vLLM、SGLang 或 TokenSpeed 部署。
值得注意的幾個限制。第一,「開放權重」不等於開放原始碼——模型採用的是 Moonshot 自己寫的「Kimi K3 License」,不是 Apache、MIT 或任何 OSI 認證的開源授權。第二,2.8T 參數的模型即使經過 MXFP4 量化,實際能跑得動的硬體門檻仍然極高——這顆模型的「開放」對多數開發者的意義,比較接近「你可以看到權重」而非「你可以在自己的機器上跑」。第三,K3 的思考模式是強制開啟的——API 回傳一定會包含 reasoning_content,token 成本包含了推理過程的消耗,不能關掉。
在 benchmark 方面,K3 在多項測試上跟 GPT-5.6 Sol、Claude Fable 5 互有勝負。但有一個方法論上的細節:不少 benchmark(DeepSWE、Terminal-Bench 2.1、ProgramBench、FrontierSWE)Moonshot 使用的是自家 Kimi Code harness 跑的,而對照組用的 harness 各異——GPT-5.6 Sol 用 Codex、Claude 模型用 Claude Code 或 Terminus 2。跨 harness 的比較本身就有雜音,Moonshot 有在技術文件中標注這一點,但 benchmark 表格裡的「第一名」標示不會附帶這段說明。
同一顆模型在 BrowseComp 上的表現也值得拆開看:開啟 1M context 不加壓縮策略時拿到 90.4 分,但 Moonshot 實際推薦的做法是在 300K token 時觸發 context compaction——換言之,100 萬 token 的 context window 在實際使用情境中不是全開的。
- 來源:HuggingFace
Anthropic 推出 Claude Opus 5:定價持平前代、自稱「歷來最對齊」,但資安分類器仍在
Anthropic 正式發表 Claude Opus 5,即日起在所有平台上線。定價跟 Opus 4.8 一樣:輸入 $5/百萬 token、輸出 $25/百萬 token。定位是「接近 Fable 5 的前沿智慧,價格只要一半」,並取代 Opus 4.8 成為 Claude Max 的預設模型、Claude Pro 的最強模型。
Anthropic 給出的核心數據:Opus 5 在 Frontier-Bench v0.1 上超越所有其他模型,在 CursorBench 3.2 的 max effort 設定下跟 Fable 5 的差距不到 0.5%;ARC-AGI 3 的分數是次佳模型的三倍;Zapier AutomationBench 的通過率約為次佳模型的 1.5 倍(以相同成本計算)。
安全與對齊的段落佔了公告相當大的篇幅。Anthropic 說 Opus 5 是「歷來最對齊的模型」——依據的是他們自己的自動化行為審計,衡量標準是模型遵守 Anthropic 自己撰寫的「Claude Constitution」的程度。同一個審計也顯示 Opus 5 在「欺騙行為」和「被誘導濫用」的指標上低於 Opus 4.8、Sonnet 5 和 Fable 5。
資安限制的設計值得細看。Anthropic 說他們「刻意避免用資安任務訓練 Opus 5」,但模型因為整體能力提升,在漏洞發現上仍然接近 Mythos 5 的水準——差距主要出現在漏洞利用(exploit development)環節,Opus 5 遠落後於 Mythos 5。為了控制這個「副作用」,Opus 5 內建了資安分類器:允許對原始碼進行漏洞掃描,但阻擋 binary-based 漏洞掃描、滲透測試和 exploit 生成。被分類器標記的請求會降級到 Opus 4.8。Anthropic 說這個分類器對 Opus 5 的干預頻率比對 Fable 5 少了約 85%。
想繞過這些限制?請加入 Cyber Verification Program(CVP)。Anthropic 說「已經是 CVP 成員的企業和研究人員可以立即使用安全限制較少的 Opus 5 版本」。誰能加入 CVP、審核標準是什麼——公告沒有說明。
附帶兩個 beta 功能:API 端自動 fallback(被資安分類器擋下的請求自動路由到其他模型,而不是直接拒絕)和對話中途更換工具而不 invalidate prompt cache。
- 來源:Anthropic
OpenAI 推出 Health in ChatGPT:接 Apple Health 和美國病歷,使用者「自主控制」資料權限
OpenAI 正式推出 Health in ChatGPT,讓美國使用者(18 歲以上)將 Apple Health 資料和支援的美國醫療系統病歷連接到 ChatGPT,用於個人化的健康問答。功能橫跨 Free、Go、Plus、Pro 方案,目前僅限美國,尚未在 Codex 上線。
運作方式:使用者在 ChatGPT 側欄的 Health 區塊連接 Apple Health 或支援的醫療機構(含 One Medical、Function Health),資料同步後,ChatGPT 可以在對話中引用這些健康資訊——預設是每次使用前跳出權限提示,使用者可以改為「永遠允許」。OpenAI 說,超過 70% 的健康相關對話發生在專門的 Health 介面之外(例如使用者在規劃飲食時順便問了過敏問題),所以這次的設計是讓健康資料「跨對話可用」,不需要先點進 Health 專區。
隱私與資料使用的承諾:連接的健康資料和引用這些資料的對話「不會用於訓練基礎模型或投放廣告」——OpenAI 強調這個限制不受使用者的一般模型訓練設定影響。中斷連接後,已同步的資料會在 30 天內從 OpenAI 系統中刪除。對話本身如果不手動刪除,會保留在聊天記錄裡。Health 對話中產生的「記憶」不會直接從病歷或 Apple Health 資料建立,但可以從對話內容中產生。
幾個值得停下來想的設計選擇。30 天的刪除窗口——對醫療資料來說不算短。Health 對話可以產生「記憶」——這些記憶會留在 ChatGPT 的個人化系統中,就算你中斷了 Health 的資料連線,已經記住的東西不會消失。OpenAI 說跨 plugin 的敏感操作(例如把根據 Apple Health 資料產生的訓練計畫送給跑步夥伴)會有「額外安全防護協助檢查」——「協助檢查」不是「阻止」。
OpenAI 請了數百位醫師設計評估情境和評分標準,GPT-5.6 Sol 在 HealthBench Professional 上的表現超越了 GPT-5.5。但 OpenAI 同時在頁尾加了一句:「ChatGPT 仍然可能犯錯,無法取代合格醫療專業人員的照護和判斷」。
- 來源:OpenAI