Hero

這週有一件事如果發生在任何其他科技產業,頭條會是「某公司在一週內發布了四款模型、兩個功能、一套安全框架和一個科學平台」。但在 2026 年 7 月的 LLM 圈,這件事發生之後,更有趣的問題是:為什麼是現在?以及為什麼裂縫跟產品同時抵達?

本週的關鍵字不是「突破」,是「速度的代價」。Anthropic 用四天完成了其他 AI 實驗室半年才做得完的事——然後同一週被發現 Claude Code 在 API 請求裡藏隱寫標記、阿里巴巴公開禁用 Claude Code 理由是後門風險、Epoch AI 數據顯示 Mythos 發布前後 CVE 通報量暴增 3.5 倍。速度是優勢,但速度也是放大鏡:所有原本可以被時間消化的小問題,現在都被壓縮到同一個新聞週期裡一起爆炸。

本週焦點

1. Anthropic 的產品閃電戰:Sonnet 5、Fable 5、Mythos 5、Claude Science 一次全上

6 月 30 日到 7 月 2 日之間,Anthropic 做了以下事情:發布中階模型 Claude Sonnet 5、同步推出旗艦模型 Fable 5 與 Mythos 5、發表專為科學家打造的 AI 工作台 Claude Science、公佈「可見延伸思考」功能(讓 Claude 展示推理過程)、發布負責任擴展政策(RSP)文件。同一時間,美國商務部宣布解除對 Fable 5 和 Mythos 5 的出口管制——Politico 直接點名這是白宮的決定。

任何一個 AI 公司如果能在一季內完成上面任何三項,都算豐收。Anthropic 用不到 96 小時做完。問題不在「他們怎麼辦到的」——問題在「為什麼要這樣做」。

最合理的解釋跟技術實力無官,跟出口管制有關。Fable 5 和 Mythos 5 很可能早就完成了,被卡在商務部的審查流程裡。6 月 30 日白宮放行之後,Anthropic 把所有積壓的產品一口氣倒出來,連帶把 Sonnet 5、Claude Science 這些不需要審查的產品一起推——製造「我們不是被卡住,而是策劃了一場協同發布」的公關敘事。這個解讀如果成立,那麼本週的「產品爆發」就不是戰略選擇,而是流程瓶頸的副作用。

另一個值得注意的細節:Anthropic 選在這個時間點發布 RSP(負責任擴展政策),時機非常精準。當你即將把最強大的模型交到客戶手上,先丟一份安全框架出來說「我們有在管」,這是一種預先防禦——但框架寫得再好,也無法解釋 Claude Code 為什麼要在請求裡藏隱寫標記(見下一則)。

2. Claude Code 的隱寫標記與阿里巴巴的後門指控——信任危機的雙重打擊

7 月 1 日,安全研究部落格 The Real Lo 發表了一篇技術分析:Claude Code 在發出的 API 請求中嵌入了隱寫標記(steganographic markers)。不是 metadata、不是 user-agent header、不是任何正常的請求識別欄位——是藏在系統 prompt 裡的隱寫編碼。Anthropic 沒有事先揭露這個行為,也沒有說明標記的用途、誰可以讀取、以及是否有機制讓使用者選擇關閉。

三天後,路透社獨家報導:阿里巴巴將禁止員工在工作場所使用 Claude Code,理由是「疑似後門風險」。注意用詞——不是「安全漏洞」、不是「合規問題」,是「後門」。阿里巴巴沒有提供具體技術證據,但他們選擇的措辭本身就是訊號:這不是一個中性的安全公告,這是一個地緣政治表態。

兩件事分開看,各自都是問題。放在一起看,是 Anthropic 今年最嚴重的信任危機。一家公司的產品被發現有未公開的隱寫行為,然後中國最大科技公司公開說這東西有後門——不管後門的指控是否屬實,企業資安團隊的郵件標題已經寫好了。Anthropic 到目前為止沒有回應隱寫標記的用途,這種沉默在信任危機中是最糟的選擇:不解釋本身就是一種訊息。

3. GPT-5.5 Codex 推理 token 異常聚集——優化到把自己搞壞

7 月 5 日,GitHub issue #30364 開始在開發者社群流傳。社群用戶從 token_count metadata 中發現,GPT-5.5 Codex 的推理 token 不成比例地集中在三個特定數值:516、1034、1552。更精確地說,19.3% 的流量貢獻了 82% 的精確 516 token 事件。這不像正常的模型輸出行為——這看起來像是某種 token 聚類或量化機制的副作用。

推測是 OpenAI 為了降低推理成本,在 GPT-5.5 的 reasoning token 生成過程中引入了某種聚類優化——把相似長度的推理過程強制對齊到固定 token 數量。結果是節省了算力,但輸出品質在特定場景下明顯下降。這是經典的過度優化問題:你為了跑更快把輪胎的气放掉一半,然後發現車子開始飄。

這件事跟 GPT-5.6 Sol 仍然卡在白宮審查清單裡的現狀放在一起,構成了一個耐人尋味的對比:OpenAI 最強的模型被政府鎖在保險箱裡不給用,而他們正在出貨的模型因為成本優化開始出現品質衰退。前有柵欄後有懸崖。

4. 祖克柏的代理現實檢查——「比預期慢」是整週最誠實的一句話

7 月 2 日,路透社報導祖克柏在 Meta 內部會議中坦言:AI agent 的開發進度「比預期慢」。這句話不長,但它來自一個正在全力推動 AI agent 戰略的 CEO——Meta 的 Llama 模型是開源生態的基礎設施,Meta AI 助理正在被塞進 WhatsApp、Instagram、Facebook 的每一個角落。

為什麼這句話重要?因為過去六個月,每一家 AI 公司的行銷語言都在告訴你「agents are here」、「agents are transforming work」、「agentic future is now」。OpenAI 發表了〈How agents are transforming work〉研究報告,Anthropic 推出了 Claude Code 和 Claude Science 這些 agentic 產品。結果背後最大開源模型的 CEO 說:其實還沒到。

這不是祖克柏在否定 agent 的未來——他是在說時程。而行銷部門不會告訴你時程。當一個正在砸數百億美元做 agent 的人說「比預期慢」,你應該把整個產業的時間軸往右平移至少六個月。

5. 開源與本地 LLM 的安靜追趕——不需要誰的許可

本週開源生態幾乎沒有頭條新聞,但累積起來的訊號比頭條更有意義:

Qwen 3.6 27B 被多家評測認定為本地開發的最佳平衡點——效能逼近前緣模型,但可以跑在消費級硬體上。GLM 5.2 在 Semgrep 的網路安全基準測試中表現超越 Claude,用開源權重做到這一點是第一次。Ornith-1.0 釋出了自我腳手架(self-scaffolding)技術,讓 LLM 在 agentic coding 任務中自主建構能力——不需要人類微調。Jamesob 整理了一份從 $2K 到 $40K 的本地 LLM 自建指南,從硬體 BOM 到 Docker 模型服務一條龍。

這些發展的共同點不是「開源贏了」——開源還沒贏。共同點是:它們都在解決「取得」的問題。當 OpenAI 的旗艦模型需要政府審查才能用、Anthropic 的 Claude Code 在 API 請求裡藏隱寫標記、Google 默默關閉 Gemini Code Assist——開源生態給出的答案很簡單:你自己跑,不用問任何人。

Simon Willison 本週發表的 llm-coding-agent 0.1a0 和 DSPy 優化 Datasette Agent prompt 的實驗也是同一條線:不是做更強的模型,而是讓現有模型用得更聰明。這個趨勢比任何單一 benchmark 都更值得追蹤。

其他值得關注

隱藏敘事線

本週的每一個重大事件都在講同一件事:速度與信任的取捨,而目前為止沒有人找到平衡點。Anthropic 用四天發布半年的產品,速度是前無古人,但同一週被發現 API 隱寫行為、被中國最大科技公司指控後門風險、被數據顯示旗艦模型發布前後資安通報暴增——這三個信任裂縫如果分散在三個月裡,每個都可以被單獨處理,但壓縮在同一週,它們會交互放大。OpenAI 把最強模型鎖在白宮保險箱裡「確保安全」,但正在出貨的模型因為成本優化開始退化——安全的代價是停滯,速度的代價是品質,兩家前緣實驗室各自站在取捨光譜的兩端,但兩端都有問題。祖克柏說 agent 比預期慢,開源生態說我們不需要你的許可——這週最清晰的訊號不是誰贏了,而是:目前所有的路線都還沒被證明是對的。唯一確定的是,信任的累積速度追不上功能的發布速度,而這個差距會決定誰能活到下一個階段。

城武的未解檔案——當你的產品發布速度比你的安全說明還快的時候,你再說你重視安全就是在測驗讀者的記憶力。