【LLM 日報】2026 年 08 月 10 日 — DeepSeek V4 Flash 用公開 harness 跑到 82.7%,離 Fable 5 只差 1.1 個百分點
今天圈子很安靜,沒有大模型發表、沒有資安災難。但要說安靜也不太對——DeepSeek 在 Terminal-Bench 2.1 上跑出了一個數字,「便宜模型追近 frontier」的趨勢繼續。同一時間,一篇小實驗用一個比洗衣機還老的統計方法,在嵌入壓縮上跑贏了 AI 圈近兩年主推的 Matryoshka。
🔥 DeepSeek V4 Flash 在 Terminal-Bench 2.1 上跑到 82.7%,使用公開 harness、成本 $68
Antigma 在 Terminal-Bench 2.1 的 leaderboard 上新增了一筆結果:DeepSeek V4 Flash 0731(max 推理等級)搭配公開的 Ante harness(v0.preview.71),在 89 個任務、各 5 次嘗試的標準設定下,拿到 82.7% 的正確率。
這個數字放在公開 leaderboard 上的位置是:僅次於 Fable 5(Claude Code,83.8%)和 GPT-5.5(Codex,83.2%),差距都在一個百分點左右。贏過 Grok 4.5(Cursor CLI,79.3%)、Opus 4.8(Claude Code,78.9%)、GPT-5.6 Terra(Codex,78.4%)。
但「贏過誰」這件事需要拆開看。公開 leaderboard 上的模型用的是不同 agent scaffold——Claude Code、Codex、Terminus 2、Cursor CLI——這些 scaffold 本身對終端操作任務的成功率影響可能不比模型小。Ante 是 Antigma 自己的開源 agent harness,Semgrep 過去的分析也指出 harness 對資安任務的影響力大於模型本身差異。所以 DeepSeek V4 Flash + Ante 拿到 82.7%,跟 Fable 5 + Claude Code 拿到 83.8%,不是同一個實驗條件下的比較。
成本方面就比較直接了:整輪 445 次嘗試(89 任務 × 5 次)總花費 $68.41,平均每次嘗試約 $0.15,總執行時間 38.9 分鐘。作為對比:Grok 4.5 在同樣 89 任務上的成本是 $242.57,GLM 5.2 是 $260.11。DeepSeek V4 Pro(上一代)的成本是 $26.34,但正確率只有 69.1%——V4 Flash 0731 的成本是它的 2.6 倍,正確率高出 13.6 個百分點。
Antigma 的 benchmark 有一個值得注意的設計原則:所有跑分都使用「pinned public release」的 Ante,不接受 eval-only branch 或 benchmark-specific prompt。這跟某些模型提交的「特調版」benchmark 提交不同——每一筆結果都連結到公開的 Harbor run,任何人都可以查看背後的原始 trial 記錄。目前有公開 Harbor link 可以審計的 model 只有 DeepSeek V4 Flash 0731、DeepSeek V4 Pro、GLM 5.2、MiMo V2.5、MiniMax M3、和 Qwen3.6 27B。Anthropic 和 OpenAI 的 model 都沒有提交 Ante 跑分。
- 來源:Antigma
PCA 打贏 Matryoshka:一個比洗衣機還老的統計方法,在嵌入壓縮上贏了 AI 圈的新寵
Dylan Castillo(Iwana Labs)做了一個實驗,拿 MRL(Matryoshka Representation Learning,AI 圈近兩年主推的嵌入壓縮技術)跟 PCA(Principal Component Analysis,1901 年發明的統計方法)在八個 BEIR 檢索資料集上正面對決。結論:PCA 在大多數壓縮比例下表現持平或更好。
以 OpenAI 的 text-embedding-3-small 為例,從 1536 維壓縮到 128 維時,MRL 截斷保留了 86% 的檢索品質,PCA 保留了 90%。壓到 32 維時差距更大:MRL 只剩 46%,PCA 還有 65%。在 Qwen3-Embedding-8B 上也看到類似模式——MRL 訓練過的模型,用 PCA 截斷居然比原生的 MRL 截斷效果更好。
一個更反直覺的發現:PCA 即使在「沒有 MRL 訓練」的老模型上也有效。Castillo 用 text-embedding-ada-002(OpenAI 上一代嵌入模型,沒有 MRL 訓練)測試,PCA 在 128 維仍保留了 89% 的品質——只比同維度下 MRL 截斷的 text-embedding-3-small 差一個百分點。換句話說,MRL 訓練的優勢在這個實驗中幾乎看不到。
實驗也順便測了量化(quantization):binary quantization + PCA 壓到 512 維,可以在保留 82% 檢索品質的同時,把向量大小壓到原始 float32 的約 1%。Castillo 自己說「這數字有點太樂觀,可能是我自己的 AI 幻覺」,但原始數據是公開的。
PCA 的代價是操作複雜度——需要 fit 一個投影矩陣、需要版本管理、query 時要記得套用同一版。但實驗顯示這些顧慮可能被誇大了:用 1,000 筆 in-domain 資料 fit 的 PCA,跟用完整 57K 筆 fit 的結果幾乎一樣;甚至 out-of-domain fit 在中度壓縮下也撐得住。
這篇的實驗範圍有限(三個模型、八個資料集、lab condition),不該被當成「MRL 沒用」的結論。但它提醒了一件事:AI 圈推新技術時,很少人回頭問「舊方法是不是其實就夠了」。有時候答案不在最新那篇 arXiv 論文裡,在一百年前的數學裡。
📡 其他值得關注
-
Ed Zitron:AI 產業 70% 營收來自 OpenAI 和 Anthropic:Ed Zitron 在新影片中引用的數據指出,整個 AI 產業的營收高度集中在兩家公司手中。如果這個數字接近事實,那「AI 繁榮」更像是兩家公司的繁榮,不是整個生態系的繁榮——對那些融了幾億但還找不到營收模型的 AI 新創來說,這不是什麼好消息。→ YouTube
-
us-vs-them:用 git history 追蹤 agentic editing 中「人寫的 vs AI 寫的」:一個 Clojure 寫的小工具,利用 git 的版本歷史和作者資訊,對任何純文字檔案產出逐行 attribution——不需要在檔案內加任何 markup。對那些被 vibe coding 產出的專案、想畫出「人類地盤」的開發者來說,是個實用的起點。35 顆星,43 個 commit。→ GitHub