今天的主題不是「AI 能做什麼」,而是「誰來定義 agent 工作的規則」。Cloudflare 開源了一個讓企業自建 agent 工作環境的平台——開放原始碼、封閉基礎設施。Neon 和 Castform 證明 4B 開源模型能在搜尋任務上打平 GPT-5.6 Sol、成本只要百分之一。Fogus 解釋了為什麼業餘程式社群對 LLM 越來越敵視:對他們來說,過程才是產品,LLM 直接跳過了整個 craft。Prime Intellect 丟出了一個能自我改良的 agent 框架,但還沒有任何模型是圍繞它訓練的。


🔥 Cloudflare OS:開源 agent 作業系統,但基礎設施不是你的

Cloudflare 發表了 Cloudflare OS,一個讓企業部署 agent 工作環境的開源平台。他們已經在內部用了幾個月——Cloudflare 自己的說法是「數千名非工程部門的員工每天都在用它產生文件、自動化重複任務、建立小應用程式」。

架構上分三層:agent 工作區(瀏覽器內的對話介面,附隔離執行環境)、安全治理框架(Gatekeepers)、以及可修改的個人應用程式平台。agent 預設無法存取任何東西——每次需要接觸內部資源時,必須向使用者請求授權,取得的是一個型別化的 capability binding,而非 API key。產出的程式碼跑在 Dynamic Worker 裡,對外網路預設關閉。

Gatekeepers 是這套架構最值得注意的部分:它是服務特定的 Worker,夾在 Cloudflare OS 和外部服務(如 GitHub、資料庫)之間,負責 OAuth、政策執行、記錄 agent 讀取了什麼。舉例來說,你可以讓 agent 只能讀某個 GitHub repo 的 issues、不能碰原始碼、對特定欄位遮罩、合併 PR 前需要人工批准。Cloudflare OS 還會記錄 agent 觀察過的每一個資源,當另一個人嘗試打開同一個工作區或查看產出時,Gatekeepers 會驗證那個人的存取權限——防止 agent 把敏感資料透過分享儀表板洩漏給不該看到的人。

Cloudflare 說他們把第一版內部用過後「完全重寫」,原因是協作場景暴露了授權問題:MCP 只能控制 agent 可以呼叫哪些工具,但不知道 agent 看到了哪些底層資源。他們的解法是把安全寫進平台層,不讓每個開發者自己實作。

這套設計的取捨很清楚:它把 agent 安全從「每個開發者自己搞定」變成「平台幫你搞定」——代價是你必須接受 Cloudflare 定義的授權模型和觀察記錄機制。程式碼開源(Apache 2.0),但執行環境是 Cloudflare Workers、Durable Objects、AI Gateway。開源的是藍圖,營運的是圍牆。


Castform + Neon:4B 開源模型在搜尋任務上打平 GPT-5.6 Sol,成本只要 1%

Neon 和 Castform 聯手展示了一個相當直接的結論:經過 RL 後訓練的 4B 開源模型,在搜尋任務上的準確度與 GPT-5.6 Sol 相當,但成本只有百分之一。

他們的路徑是這樣:傳統的 multi-turn agentic search 每一輪都要呼叫 frontier 模型——以 GPT-5.6 Sol 為例,單次請求耗時超過 10 秒、成本約 $0.03。小模型便宜 100 倍,但開箱即用的能力差一大截。Castform 做的事情是 RL post-training:把你的資料庫當訓練素材,自動從文件產生 QA pair,定義 reward function(檢索正確率+引用正確率+答案正確率),然後讓小模型在迴圈中自我改良。

Neon 的角色是提供基礎設施:Lakebase Search 做混合搜尋(BM25 + vector + RRF merge),加上動態運算擴容來吸收訓練過程中爆發式的搜尋請求。Neon 的 branching 讓每次 agent rollout 拿到隔離的資料庫狀態,time-travel queries 則用來重建 agent 遇到的確切狀態——避免訓練中的 agent 互相污染或碰到正式環境。

值得標記的點:Castform 的目標是把 RL post-training 變得「跟寫 prompt 一樣簡單」。創辦人 Seah 的說法是「多數團隊最好的訓練資料就躺在他們的資料庫裡,問題是把原始資料變成可用的東西太難」。這句話的背面是:如果你的資料沒有好好整理、沒有乾淨的 ground truth,這條路徑對你來說還是封閉的。4B 模型打平 GPT-5.6 Sol 的前提條件是:你已經有一組整理好的語料庫,而且你有能力定義什麼叫「正確答案」。


Born Against:為什麼業餘程式社群對 LLM 充滿敵意

Michael Fogus(《The Joy of Clojure》作者)寫了一篇短文,試圖解釋為什麼象棋引擎開發、OSDev、程式語言設計、模擬器開發、demoscene、code golf 這類業餘程式社群對 LLM 的態度越來越敵視。

他的核心論點:在這些社群裡,「過程本身就是產品」。把程式跑起來只是 nice-to-have——真正被看重的是你理解程式為什麼這樣跑、以及你如何走到那裡。尊重是透過長年在論壇上分享優雅的程式碼、展現真正的好奇心、貢獻深層領域知識而累積的。一個用 LLM 生出來的象棋引擎——即使它真的能跑——對這些社群來說「完全錯過了重點」。

Fogus 也承認這些社群本來就以激烈的 gatekeeping 和極度緩慢的進度聞名,所以 LLM 使用者帶著「快速通關」的心態闖入,注定會撞牆。他的原話:LLM 是「力量乘數,不是替代品」。在已經理解領域的專家手中,它可以當槓桿;但在這些把學習本身當成目的的社群裡,用 LLM 跳過過程不是捷徑,是偷走了 craft 本身。

他同時補了一句很重要的但書:即使專家也無法天然免疫被 LLM 欺騙。所以「讓專家用 LLM 當槓桿」和「讓新手用 LLM 當替代品」之間的界線,比表面上看起來更模糊。

這篇不是反 AI 宣言。Fogus 自己也在持續寫他對 LLM 的思考演變(前兩篇是 LLMe 和 Mind the van Emden Gap)。比較像是一個在兩個世界都有經驗的人,試圖解釋為什麼這兩個世界的衝突不是誤解,是結構性的。


Prime Agent:能自我改良的 RLM agent 框架,開源

Prime Intellect 發表了 Prime Agent,一個以「自我改良」為核心設計的開源 agent 框架。兩個關鍵抽象:Recursive Language Model(RLM)和 Continual Harness。

RLM 把 context 當變數、把子 agent 呼叫當成 REPL 裡的 async function call。模型可以在 IPython kernel 裡直接寫 await rlm("子任務") 來平行啟動多個子 agent,事後透過 agent_message.send() 繼續跟它們溝通。整個 session 的歷史存成 append-only JSONL,支援 branching/forking/cloning。

Continual Harness 的設計更激進:agent 可以在執行期間對自己的 prompts、skills、memory、sub-agents 做 CRUD。範例是 agent 發現某個測試 pattern 會 flaky,就在 harness 裡新增一條 memory 記錄「遇到這個 pattern 就重試三次」。/refine 是自動化的自我改良管線:讀取 agent 自己軌跡、找到失敗模式、提出最小的 CRUD 修改、記錄修改的原因和結果——改良是可追溯得,可以 rollback。

效能數據:ARC-AGI 3 上用 Opus 5 跑到 95.5% RHAE Best@1,超過官方的人類專家 baseline(95.4%)。在長上下文 coding 任務上,Prime Agent 搭配 GLM 5.2 在多個 benchmark 上與封閉模型專屬 harness(Claude Code、Codex)競爭。但有一個關鍵前提:目前沒有任何模型是圍繞 Prime Agent 訓練的——這些成績是拿為其他 harness 優化的模型塞進 Prime Agent 跑出來的。換句話說,框架設計是面向未來的,但當下的模型還沒有針對它調校過。

Prime Agent 全面開源,CLI 一鍵安裝。支援 autonomous mode(--autonomous),可以設定 token 預算、turn 上限、gate command。


📡 其他值得關注

  • Position: LLMs Can’t Jump:OpenReview 上的一篇 position paper,論證 LLM 在需要「跳躍性推理」的任務中存在結構性限制。→ OpenReview

  • Oracle 砍 Always Free ARM 資源:從 4 OCPU / 24GB 降到 2 OCPU / 12GB,8 月 18 日生效。對白嫖自架服務的開發者圈影響不小。→ CNElecar

  • HyperProbe(YC S26):做 read-only 的 prod debugging agent,不碰資料、只讀不寫,定位是「給 on-call 工程師的輔助輪」。→ HyperProbe