【LLM 日報】2026 年 07 月 27 日 — OpenAI、Google、Mistral 各自推出企業 agent 基礎設施,沒人在推新模型
今天的 LLM 圈沒有人推新模型。三家主要玩家各自在推同一件事:讓 AI agent 變成企業可以「信任」的生產力工具。OpenAI 是白手套全包式管理服務,Google 是 API 級基礎設施元件,Mistral 是 prompt 治理層。三條路線得共同前提是:模型本身已經夠好了,接下來的瓶頸不是智力,是企業敢不敢把客服、理賠、內部流程交給它。
🔥 OpenAI Presence:企業 agent 平台,但你得先過 OpenAI 業務那關
OpenAI 發表了 Presence——一個企業級 AI agent 平台,定位是讓企業部署「可信賴」的語音和文字客服 agent。這不是一組 API,是一個由 OpenAI Forward Deployed Engineers(FDE)帶領的部署產品。
Presence 的核心運作方式:企業設定政策(agent 能做什麼、什麼時候要人類核准、什麼時候該升級給真人),Codex 監控正式環境的對話,找出落差後提出修改建議,團隊審核後上線。OpenAI 自己的電話客服專線(1-888-GPT-0090)已經在用,官方說法是目前能自行處理 75% 的進線問題,Codex 驅動的改善循環在 10 天內把轉接真人的比例再降了 15 個百分點。
公開的客戶名單:BBVA(墨西哥銀行業務)、SoftBank(日文客服)、IAG(天災期間的保險理賠)。三家都是「正在探索」的階段,不是「已全面部署」。
限制條件比功能清單更值得讀。第一,Presence 目前是「limited general availability」——只有透過 OpenAI FDE 和「特定全球系統整合商」才能部署,沒有自助開通管道。第二,定價沒有公開,頁面上寫的是「contact your OpenAI account team」。第三,OpenAI 說他們會「alongside each customer」來識別工作流程、連接系統、建立權限——翻譯成白話:你買的不是軟體授權,是一組顧問服務,平台只是服務的載體。
把 Presence 跟 OpenAI 的 API 業務放在一起看:一邊是開發者自己拼裝模型、工具、評估管線;另一邊是企業客戶把整個客服營運外包給 OpenAI,連 agent 行為的持續改善都交給 Codex 建議、人類蓋章。OpenAI 正在從模型供應商轉型成 agent 營運商,而這條轉型路徑的入口不經過開發者——經過的是採購部門。
- 來源:OpenAI
🛸 Project Pilot:Anthropic 讓 15 顆前沿模型學開無人機,Fable 5 飛得最好但還不會認路
Anthropic 的 Frontier Red Team 跟 Andon Labs 合作,發表了一項讓 AI 模型自主控制無人機的評估研究。他們測試了 15 顆模型——從 GPT-4o 到 GPT-5.6 Sol 和 Fable 5——任務是在室內辦公室找到指定人物並跟隨,也就是空中監控最基礎的「定位後追蹤」流程。研究同時產出了一個新 benchmark:Drone-Bench。
任務拆成五個子項目:3D 場景重建、定位、導航、偵測、跟隨。Andon Labs(不是 Anthropic)用自己的人機協作團隊對每個子項目建立了 baseline,模型只要達到或超過 baseline 就算過關。
結果:Fable 5 表現最好,在五個子項目中四個達到 baseline,但卡在 3D 重建——模型無法從影片準確重建辦公室的空間結構,導致導航失敗,無人機無法自主在房間之間移動。在 10 次模擬中,Fable 5 平均只在三個子項目穩定達到 baseline,距離「可靠」還有距離。
幾個值得注意的細節。硬體:DJI Tello EDU,一台 $129 美元的玩具級四軸機,不是什麼軍規平台。環境:單一辦公室平面圖、少數人員、慢速飛行、無戶外測試、無人群——Anthropic 自己在論文中列出這些限制。一個不尋常的安排:Anthropic 說他們沒有取得 Drone-Bench 的存取權,所有評估由 Andon Labs 獨立執行。一家公司發表 benchmark 結果但自己無法驗證數據——這在業界不常見。
Anthropic 的論點:一旦模型通過能力門檻,「把人類留在 loop 裡」會從安全措施變成成本負擔。他們用 coding agent 從「每個 tool call 都要人類核准」演進到「最小干預下執行長週期任務」的歷史來對比——無人機領域可能走上同一條路。他們的結論是:在效率不該是唯一考量標準的領域(涉及人身安全和隱私),這些決定必須是刻意的,不能讓成本壓力自然推動。
- 來源:Anthropic
🌐 Gemini Managed Agents:Google 加背景執行、MCP 遠端連線、自訂函式
Google 為 Gemini Interactions API 的 Managed Agents 擴充了四個新功能,都是開發者回饋中呼聲最高的基礎設施需求:
背景執行:不再需要為了長任務保持 HTTP 連線。傳入 background: true,API 立刻回傳 interaction ID,客戶端可以輪詢進度或稍後重連——不需要自己架 job queue。
遠端 MCP 伺服器:agent 可以直接連線到企業內部的 Model Context Protocol 伺服器(資料庫、觀測平台、內部 API),不需要再寫一層自訂 proxy。可以跟內建工具(程式碼執行、Google Search)混合使用。
自訂函式+沙箱工具並行:在一個互動中同時使用 Google 的沙箱工具和客戶端自訂函式。API 自動追蹤哪些工具在伺服器端執行完畢、哪些需要客戶端處理——不需要工程師自己管理狀態機。
憑證刷新:更換 token 或 API key 時,沙箱的檔案系統、已安裝套件、已 clone 的 repo 會保留,不會因為換憑證就被清空。
Google 的路線跟 OpenAI Presence 正好是光譜的兩端:OpenAI 賣的是「你不需要懂基礎設施」的白手套服務,Google 賣的是基礎設施元件本身——你拿這些元件去組你自己的 agent 平台。一個鎖定採購部門,一個鎖定開發團隊。
- 來源:Google
📡 其他值得關注
-
Mistral Studio 為 prompt 和 skill 加上版本控制:Mistral 在 Studio 中加入 prompt/skill 的版本管理系統——immutable versions、audit logs、owner tracking、rollback、staging/production 標籤。核心論點:企業內 prompt 散落在程式碼倉庫、Notebook、Slack 討論串裡,業務團隊懂該寫什麼但打不進程式碼流程,工程師卡在每一次 wording 調整的 CI/CD。Studio 讓非工程人員可以直接迭代 prompt 並測試,正式上線仍走既有的審核管線。目前開放給 Mistral Studio 客戶。 → Mistral
-
Cursor Bridge:用 Cursor 訂閱跑 Claude Code,不另外付費:開源工具,把 Claude Code 的工作負載透過 Cursor 的 API 配額執行——訂了 Cursor 就不用另外付 Anthropic 的錢。GitHub 上已開源。 → GitHub