今天三條新聞指向同一個方向:介面層一步一步往後挪。Mistral 把檢索從「撈一次 top-k」換成一串 search → read → grep → verify 的連續動作;DeepSeek 把視覺理解併進既有的對話介面,圖片被換算成 token 計價;Anthropic 則在文字離手之前,先蓋上一道不打地區之分的全球浮水印。模型自己會查、自己會看、自己被標記——做的事變多了,能夠決定這一切的人數,官方說法裡沒有變多。


🔥 Mistral Agentic Search:把檢索從一次抓取,改成一連串動作

Mistral 於 8 月 20 日發布 Agentic Search,官方定位是「檢索層」(retrieval layer)。傳統的一次性 RAG 只撈固定幾段文字、讓模型一次作答;Agentic Search 改成迴圈——模型可以反覆執行 search、open、navigate、read、grep 等工具,直到找到並驗證答案為止。Mistral 給的對照案例是:一次性的路徑只做一次 search 就回報「缺 7-12 月資料」,Agentic Search 的路徑則連續兩次 search、再 read 指定 PDF 的第 15 頁,把 1953 年逐月國防支出的 12 個數字全部抓齊加總。

官方宣稱的數字集中在三項:正確度(在 FinanceBench 上宣稱 +45.6 分、約 3 倍)、延遲(最多降 39.6%)與 token 用量。Mistral 同時明講這些是「下限而不是上限」(floors, not ceilings)——意思是數字是拿預設 chunking、預設 ranking、沒有調參測出來的。文案反覆強調「不需要 fine-tune、不需要模型特訓」,並用自家 Mistral Medium 3.5 與第三方 GLM 5.2 各測一輪,說兩邊表現一致,藉此主張「retrieval 品質會隨模型能力一起長,而不是被 chunking 策略卡死」。

那句話是這篇的核心敘事,也是值得放大的地方:「答案」不再是撈一次就定案,而是由一連串工具動作組成的過程。過程「查幾步、什麼時候算夠」由模型搭配檢索工具共同決定,數字是 Mistral 自己量的,判準也都是它定義的——官方說法是這樣,原始資料沒有公開。


DeepSeek-v4-flash-vision-exp:視覺併進對話,圖用 token 計價

DeepSeek 於 8 月 21 日在 API 文件新增實驗性視覺模型 deepseek-v4-flash-vision-exp,接在既有的 v4-flash 介面上。支援文字與圖片混合輸入,圖片可以經 base64、外部 URL 或 Files API 傳入;介面層相容 Chat Completions、Messages 與 Responses API。官方描述把它定位成「能平滑地跨 agent framework 運作,把視覺理解跟各式各樣工具結合」。

計價方式是把圖片「token 化」:每張圖最多換算成 384 個 token,依 V4-Flash 的定價計費。文件也列出 image detail 參數——low 會在推理前把圖縮到 512×512(較快較省),high 與 original 保留原圖(文件註明 high 只是相容性提供,等效於 original)。Web 介面宣稱 free to use,圖片上傳一次、之後用 file_id 反覆引用,不用重傳。

值得追一下的是計價的敘事本身:把圖片「換算成 token」,等於把視覺成本翻譯成語言成本的計費語言——一張圖實際多少錢,由 DeepSeek 自己的 token 換算規則決定,文件沒有揭露「視覺 token」到實際像素之間的換算細節。實驗性(exp)模型的定價與能力隨時可能改,目前文件給的就是 API 端點這些表面規格。


Claude 文字浮水印全球上線:歐盟監管,套在所有人身上

Anthropic 於 8 月 14 日發布技術說明,交代 Claude 的文字浮水印如何運作。機制是這樣:LLM 逐 token 生成時,會在意思幾乎等價的候選詞之間用一個偽隨機數來決定最終選項——例如「The weather today was cold and…」後面接「overcast」或「grey」對讀者沒差,這個選擇就交給隨機運氣。水印就嵌在這些「無關緊要的隨機選擇」裡,人類讀起來無感,但可以被偵測。

Anthropic 說明觸發原因是歐盟 AI Act:對 AI 生成文字要求「標記」(marking)。Anthropic 與約 190 個簽署方一起,在 2026 年 7 月簽了 EU Code of Practice on Transparency of AI-Generated Content。官方說法給了一個關鍵理由——水印選擇「全球套用」,「因為目前還沒有能針對地區限縮的持久方案」。歐盟對 2026 年 8 月 2 日之前發布的模型設有過渡期,Anthropic 說未來幾個月會為這些舊模型逐步補上。

被「無法按地區限縮」一句話帶過的,是範圍問題:歐盟的監管,最後等效於全世界所有 Claude 使用者都被標記——非歐盟使用者對這條法律沒有投票權,卻被同等對待。誰能讀出水印、誰能驗證、誰能移除,官方說法沒有指定公開的判準,一般使用者只在輸出端看到結果。


📡 其他值得關注

  • MicroGPT-C:純 C 的 inference,宣稱在 Apple M5 上達 10M TPS:開源專案,用純 C 寫的模型推理,README 宣稱在 Apple M5 上每秒約 1000 萬 token——數字先看看就好,是單一硬體、單一模型的實測還是理論值,文件沒有展開。→ github.com

  • OneCLI(YC S26):開源、sandboxed 的 agent harness:Launch HN 上的計畫,主打給團隊用的 OSS、隔離環境的 agent 執行框架。→ github.com

  • 在 $27 的智慧手錶上跑 Claude:Mike Kasberg 寫了篇他在一台約 27 美元的手錶上、用 Claude 邊走邊寫程式的實驗紀錄,算是帶有手工感的 agent 終端實戰。→ mikekasberg.com

  • Seed:極簡、可自我修改的 agent harness:開源專案,主打小體積,agent 可以自己改自己的 harness。→ github.com