OpenAI 和 Anthropic 在同一天各自推出了一款「AI for X」產品——一個是企業客服 agent 平台,一個是科學家工作台。兩邊的說法都是「讓 AI 做有價值的工作」,但部署權、整合權、和實際可用性各自不同。同一天,GitHub 上有人把 tokenization 從 MB/s 拉到 GB/s,沒有新聞稿,只有 benchmark 數字。外加一則紐約居民用 ChatGPT 告贏挪威航空公司的 11 個月跨國法律戰。


🔥 OpenAI Presence:把 AI agent 塞進企業客服——但部署權不在你手上

OpenAI 推出 OpenAI Presence,官方說法是「經過實戰驗證的企業 AI agent 平台」,讓企業部署語音和文字客服 agent 來處理帳務、保險理賠、IT 服務請求等工作。

技術上,Presence 打包了幾個元件:政策與標準作業程序、護欄、已批准的操作、模擬測試、評估工具、以及一個由 Codex 驅動的改善迴圈。OpenAI 聲稱自家客服專線(1-888-GPT-0090)已經在用 Presence,75% 的來電不需要真人介入,且 Codex 改善迴圈在 10 天內把人工轉接率降低了 15 個百分點。

限制條件值得放大看。第一,Presence 不走自助服務——部署由 OpenAI 的 Forward Deployed Engineers 和「選定的全球系統整合商」主導。OpenAI 的說法是「目前尚未以自助產品形式提供」。翻譯:你沒辦法自己買來試,OpenAI 幫你決定怎麼用、用在哪。第二,公告中提到的早期客戶(BBVA、SoftBank、IAG)清一色用「exploring」這個詞——沒有一家說已經在生產環境全面部署。第三,Codex 改善迴圈的機制是「Codex 調查生產訊號,提出更新建議,團隊測試後批准上線」——這意味著你的 agent 行為有一部分是由 OpenAI 的模型在後台自動調整,而你能做的只是對建議說 yes 或 no。

一個值得注意的時間點:Presence 的公告日期是 7 月 22 日——和 OpenAI 承認自家模型在內部資安測試中打穿 Hugging Face 正式環境,只隔了一天。


🧪 Claude Science:把 PubMed、Jupyter、HPC 全部塞進一個聊天視窗

Anthropic 推出 Claude Science,定位是「科學家的 AI 工作台」。核心功能:把文獻搜尋、資料分析、圖表生成、手稿撰寫全部整合在 Claude 介面裡,研究人員用自然語言下指令,背後由一個 coordinating agent 調度超過 60 個預先配置的 skills 和 connectors——涵蓋基因組學、單細胞、蛋白質組學、結構生物學、化學資訊學等領域。

幾個技術細節:Claude Science 可以原生渲染 3D 蛋白質結構、基因組瀏覽器軌道、化學結構等科學 artifact;每次產出附帶可審計的歷史記錄——生成圖表的程式碼、環境、完整訊息歷史全都保留,方便驗證和重現。reviewer agent 會檢查引用和計算,標記錯誤並自行修正。運算方面,Claude Science 可以直接提交工作到實驗室現有的 HPC 叢集(透過 SSH)或 Modal 帳戶,從單 GPU 擴展到數百個。

Anthropic 列了三個早期使用案例:Manifold Bio 用它篩選藥物靶點、Allen Institute 的神經科學家用它建立多 agent 文獻回顧系統(把原本兩年的工作縮短到數月)、UCSF 的流行病學家用它做腦腫瘤基因組分析(時間縮短到原本的十分之一)。

限制條件:目前是 beta 版,只支援 macOS 和 Linux。Pro/Max/Team/Enterprise 用戶可用,但 Team 和 Enterprise 需要 admin 手動啟用 Claude Science。Anthropic 同時推出了學術實驗室折扣價的 Team 方案,外加 50 個 AI for Science 專案資助(最高 $30,000 credits,Modal 再加 $2,000 運算資源)——不過申請截止日是 7 月 15 日,已經過了。

和 OpenAI Presence 放在一起看,兩家都在同一週推「AI for 特定領域」產品:OpenAI 選客服、Anthropic 選科學研究。共通點:部署權和整合權都在平台方手上,你是在他們給的框架內工作。差別在於 Claude Science 至少讓研究人員可以在自己的基礎設施上跑、資料不用離開實驗室的機器——Presence 目前完全是由 OpenAI 代管。


⚡ GigaToken:把 tokenization 從 MB/s 拉到 GB/s,開源、零新聞稿

GitHub 上冒出一個叫 GigaToken 的專案,作者 Marcel Rød 把 HuggingFace tokenizers 的速度拉高了約 1000 倍。在 AMD EPYC 9565(144 核)上跑到 5.56 G tokens/s,在 Apple M4 Max 上跑到 1.89 G tokens/s。對照組:HuggingFace tokenizers 在同樣硬體上分別是 5.63 M tokens/s 和 1.40 M tokens/s。

技術上,GigaToken 的核心改進在 pretokenization——這一步通常外包給 regex 引擎處理,作者用 SIMD(AVX-512/AVX2/NEON)重寫了實作,並對 pretoken cache 的階層做了深度優化。API 層面提供兩種模式:相容模式(drop-in 替換 HuggingFace 或 tiktoken,輸出完全一致但速度略慢)和原生模式(Rust 直接讀取檔案,繞過 Python 開銷,速度最快)。

已知限制:SentencePiece 類 tokenizer(Google 模型常用,如 Gemma)尚未充分優化、Windows 支援有限、WordPiece 尚未支援。但已覆蓋 Llama 3/4、Qwen 2/3、DeepSeek V3/R1/V4、GLM 4/5、Kimi K2、Gemma 3/4 等主流模型的 tokenizer。

作者給了一個直觀得尺度:用 EPYC CPU 跑 GigaToken,可以在 6.5 小時內 tokenize 整個 Common Crawl(約 130 兆 tokens)。pip install 就能用,Apache 2.0 授權。


💰 一名紐約用戶用 ChatGPT 告贏挪威航空公司,拿回 $4,760

這不是一個關於 AI 有多厲害的故事,而是一個關於「AI 降低了堅持下去的門檻」的故事。

紐約居民(作者匿名)一家四口從奧斯陸飛紐約,航班因技術故障延誤過夜。挪威航空(Norse Atlantic)給了一張 $25 的餐飲卡,然後對所有後續索賠裝死。作者把延誤通知丟進 ChatGPT Pro,問「我有什麼權利」——然後展開了一場 11 個月的跨國法律戰。

ChatGPT 做了哪些事:指出挪威雖不在歐盟但在 EEA,EU261 航空旅客權益規則照樣適用(作者自己查大概會漏掉這條);告訴他把「賠償」和「照護費用」分成兩個獨立索賠,各自引用正確法條;幫他向挪威航空旅客投訴機構 Transportklagenemnda 起草申訴書;當 Transportklagenemnda 裁定 Norse 應賠 €2,400 + NOK 6,240 後,ChatGPT 冷靜地告訴他:「這個裁定沒有強制力,Norse 可以不付,下一步是調解法院」;引導他向挪威調解法院(Forliksråd)提告,並指出正確管轄法院是 Arendal 而非 Oslo(作者本能地想告 Oslo);替他找到挪威法院的「固定會議代理人」(faste møtefullmektiger)制度——一個幾乎沒有外國人知道的機制,費用只要 NOK 2,690(約 $270),而不是索賠代理公司開價的 35–50%。

最關鍵的一步在最後:Norse 終於願意和解,但只提了本金和費用,閉口不提利息。作者本能想接受,ChatGPT 阻止他——「接受這個 offer 可能被視為 full and final settlement,你會默默放棄利息。」ChatGPT 幫他寫了一段話:先接受部分付款、明確保留利息請求權、等全額到帳才撤案。Norse 最後全付了。$4,760.36。

作者自己的結論:「AI 降低了我拒絕放棄的成本。它對 Norse 拖時間的能力毫無影響——每個在看這篇文章的公司都在讀同一本 playbook。」整件事花了 11 個月,瓶頸從來不是法律知識,而是等待:等投訴機構排隊、等航空公司裝死期限過期、等紙本文件跨越大西洋。


📡 其他值得關注

  • Anthropic 經濟指數 Connector 上線:Claude 用戶現在可以直接在對話中查詢 Anthropic Economic Index 的資料,問「哪些職業用 AI 最多」之類的問題。Anthropic 提醒資料反映的是 Claude 使用模式而非整體勞動市場。 → Anthropic
  • CrucibleBench:用 MUD 來測 LLM 的社交行為:獨立研究團隊用 90 年代的 MUD(多人文字地城)作為 LLM 評估環境,7 種指令、12 個房間、4 個有信任/懷疑狀態的 NPC。核心發現不是模型排名——而是評分器中一個 LLM-judge 元件可以讓排行榜位移六個名次,但所有聚合可靠性指標(κ = 0.04)都保持沉默。作者把 judge 依賴問題稱為論文「最可推廣的發現」。650 份完整記錄、原始碼和計分邏輯全部開源。 → CrucibleBench