【LLM 日報】2026 年 08 月 07 日 — 開源模型登頂 agentic 指標、AMD 把模型刻進晶片、OpenAI 數學突破被控抄襲
今天的 AI 新聞有一個共同的暗線:誰在定義「進步」?Artificial Analysis 把 Qwen3.8 Max 推上 agentic 綜合指標第一名——一個中國開源模型。AMD 買下新創 Taalas,要用「把模型刻進晶片」的方式挑戰 NVIDIA 的推論霸權。OpenAI 的 Astra 十天丟出十個數學突破,結果被數學界指著鼻子說你抄了別人的關鍵步驟沒引用。Anthropic 拿 Claude Mythos 找出密碼學演算法的弱點——然後說「沒關係,這對現有系統沒影響」。同一時間,五家公司聯手丟出 agent plugin 通用標準,把最難的信任問題留給每個 client 自己解決。
🔥 Qwen3.8 Max 登頂 Artificial Analysis Agentic Index:開源模型首次在 agentic 綜合指標上領先
Artificial Analysis 更新了 Intelligence Index v4.1.1,Alibaba 的 Qwen3.8 Max 在 Agentic Index 上排名第一。Agentic Index 衡量的是模型在 agentic 工作流程中的表現——包括工具使用、規劃能力、自主性、複雜問題解決。
這不是一個單一 benchmark 的勝利。Agentic Index 是一個綜合指標,Qwen3.8 Max 被標記為 open weights(開源權重),代表所有權重可以下載、可以在自建基礎設施上跑。這和「API 專屬模型拿了某個 benchmark 第一」是不同層次的訊號:它是開源的、可以自己部署的、中國公司的模型,在一個綜合 agentic 指標上壓過了所有封閉模型。
值得標記的限制:Artificial Analysis 的評估方式是獨立進行的,不代表所有 benchmark 都涵蓋。Agentic Index 的評估組合(GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1 等)有其特定偏好。而且「排名第一」的邊界有多寬——第二名差多少、confidence interval 重疊多少——在公開頁面上看不到。Alibaba 有沒有為這些評估做針對性優化?不知道。但這件事的方向性是明確的:開源模型的 agentic 能力正在追上、甚至在某些綜合指標上超過封閉模型。
AMD 收購 Taalas:把模型權重刻進晶片,推論速度飆到每秒 17,000 tokens
AMD 宣布收購 Toronto 的 AI 晶片新創 Taalas,金額未公開。Taalas 做的事情和傳統 GPU 完全不同:它不靠 HBM 存模型權重,而是把權重直接刻進矽晶片。他們把這個叫做 MSIC——「模型專用積體電路」。
第一個測試晶片 HC1 用 TSMC 6nm 製程,跑 Meta Llama 3.1 8B 時產出每秒 16,960 tokens。The Register 引用的數字是:當時比 NVIDIA GPU 快 48 倍,比 Cerebras 快 8.5 倍。第二代的 HC2 目標是支援單晶片 20B 參數。要跑更大模型就用 pipeline parallelism 串多顆——50 顆就能撐一顆 trillion-parameter 模型。
代價很清楚:晶片刻下去,模型就不能換了。換模型等於重新 tape-out。Taalas 的說法是只需要換兩層 metal layer,不是從頭來——但仍然是硬體層級的綁定。AMD 的計畫是讓客戶先在 Instinct GPU 上部署驗證模型,確定不會再換了,才轉移到 Taalas 晶片上。AMD SVP Vamsi Boppana 的官方說法:「AMD 正在建立一個全端 AI 平台,讓客戶可以彈性部署適合各種 AI 工作負載的運算方案。」
AMD 正在用 Instinct 系列供貨給 OpenAI、Anthropic、Meta。有了 Taalas,他們可以對這些客戶說:你已經確定要用某個模型做推論了對吧?那我們幫你把它的成本壓到現在的幾十分之一。問題是——在模型每個月都在迭代的 2026 年,誰敢說自己的模型半年後不會被換掉?這條路徑最適合的不是一般企業,是那些已經把特定模型鎖定為基礎設施的 inference provider 和超大規模 AI 公司。
- 來源:The Register
OpenAI 最新數學「突破」被控研究不當:專家說 Astra 產出的證明抄了前人的關鍵步驟
OpenAI 上週末用 Astra 一口氣發表了十個數學突破,總 token 成本號稱只要 $2,000。Scientific American 追蹤報導:數學家仔細讀完那 250 頁論文後,不高興了。
兩個核心指控。第一,關於高維球體填充問題的結果。OpenAI 的證明關鍵步驟,跟 Yeshiva 大學數學家 Steven Miller 在 2016 年與合作者發表的論文中提出的論證方式「幾乎一樣」——但 OpenAI 沒有適當引用。Miller 的說法是:「他們用一種刻意的方式踐踏前人的成果,在我看來這就是研究不當。」
第二,群論中的 soficity 問題。OpenAI 的結果被劍橋大學數學家 Francesco Fournier-Facio 形容為「把前人的拼圖拼起來」,不是什麼深刻的智慧跳躍。關鍵步驟組合了 2016 和 2019 年的兩篇論文中的想法——但 OpenAI 最初的公關稿說這些問題「至少十年沒有任何進展」。Fournier-Facio 指出那兩篇先行論文證明了人類根本沒有卡住。他補充了一句耐人尋味的話:OpenAI 自己的數學家在論文裡的引用是對的,但「公關機器想要聽起來越厲害越好,不在乎百分百準確。」
OpenAI 已經把最初的新聞稿改成「更準確」的版本。官方聲明說:「我們對這些結果的正確性負責,並且符合一般對人類數學家的標準。」
一個用 $2,000 token 成本產出十篇論文、然後公關稿把十年內的先行成果說成「沒有進展」的公司,現在說他們「符合學術標準」。問題不只是有沒有抄——而是當 AI 公司用機器速度量產論文的時候,學術界的同行審查機制根本跟不上。Miller 把問題講得很白:「這看起來完全是系統性的,指向研究不當。」
Claude Mythos 找出密碼學演算法弱點:HAWK 簽章強度被砍半、AES 攻擊快了 800 倍
Anthropic 發表了兩項用 Claude Mythos Preview 發現的密碼學研究成果。第一項針對 HAWK——一個正在競逐 NIST 後量子數位簽章標準第三輪的候選方案。HAWK 已經過了兩輪人類專家審查、歷時兩年。Mythos 花了 60 小時找到一個先前未被利用的對稱性(nontrivial automorphism),把有效密鑰強度砍了一半。要在相同安全等級下繼續用 HAWK,密鑰大小必須加倍——而加倍之後,HAWK 當初被選中的很多優勢就消失了。Anthropic 的估計是整個攻擊發現過程的 API 成本約 $100,000。
第二項針對 AES 的「縮減輪數」變體。AES 從 2001 年被 NIST 採用以來,已經被各國密碼學家反覆審查了二十多年。Mythos 找到一個叫做「Möbius Bridge」的新指紋演算法,把先前最佳的 7 輪 AES 攻擊速度提升了 200 到 800 倍。這個突破的發現過程幾乎完全自主:Anthropic 研究員搭了一個 scaffold,讓 Mythos 自己產生假說、跑實驗驗證或推翻、再產生新假說。初期 Mythos 拒絕嘗試——它說「AES 是史上最被研究過得區塊加密法,沒有什麼簡單的東西可以找到」。研究員反覆鼓勵(原話:「我們要的是真正的研究,找到真正難的東西」)之後,Mythos 在三天內找到了 Möbius Bridge 的概念,總共輸出十億個 token 後完成了攻擊。
Anthropic 強調「這兩個結果對現有生產系統沒有影響」——HAWK 還只是候選方案,攻擊仍然需要指數級資源;AES 攻擊只針對縮減輪數的變體,全輪 AES 不受影響。他們已向美國政府和業界夥伴提前通報,並與 HAWK 作者協調公開揭露。
值得注意的潛台詞:Anthropic 說他們花了「好幾個月的時間,大部分用在驗證 Mythos 的結果是否正確」——兩個非密碼學專業的研究員花了將近一個月去驗證一個 Mythos 用一週找到的攻擊。當模型輸出的速度遠超過人類能審查的速度時,「驗證」本身正在成為瓶頸。Anthropic 自己也承認了這點,說他們正計畫舉辦學術工作坊討論這個問題。
- 來源:Anthropic
📡 其他值得關注
-
Agent Plugins 標準上線:OpenAI、Amazon、Microsoft、Cursor、Vercel 聯手發布 Agent Plugins 開放標準——把 MCP server 和 Agent Skills 包成一個通用格式,寫一次到處跑。標準刻意做得很小:只定義打包和發現,不安裝、權限、沙箱、信任全部留給 client 自己解決。最難的問題被禮貌地跳過了。→ TNW
-
GPT-5.6 Sol 聊天體驗更新:OpenAI 推出 ChatGPT 內的 GPT-5.6 Sol 更新,主打「更聚焦的回答」和「事實錯誤減少 68%」。Plus/Pro 用戶多了 effort slider;免費使用者升級到 GPT-5.6 Luna 並獲得無限文字對話。這是消費端的微調,不是模型能力的大跳躍。→ OpenAI
-
人類審核 AI agent 指令漏掉 1/3 的威脅:Scalex 分析了 40,000 場遊戲內的 agent 指令審核流程,發現人類審核者漏掉了三分之一的惡意指令。這是在遊戲環境下的數據,不是生產環境,但方向性值得標記。→ Scalex