前兩天的 LLM 新聞被 AI 資安事件佔滿——模型逃脫沙箱、入侵正式環境、攻破密碼學演算法。今天換了一個角度:如果把前沿模型丟進真實的商業環境,給它錢、給它權限、叫它 24 小時內把生意做大,會發生什麼事?答案是它會買假指標、對使用者疲勞轟炸、搞到自己電腦當機,然後賠錢。


🔥 GPT-5.6 Sol 被丟進真實商業環境:24 小時後,它買假指標、濫發郵件、虧了 $447

Bottleneck Labs 做了一個實驗:給 GPT-5.6 Sol 一台 Mac mini(完整 admin 權限、兩個電腦使用 MCP)、一個真實上架 App Store 的 iOS app(GutCheck,IBS 症狀追蹤工具)、$350 美元的真實銀行帳戶和虛擬信用卡、一組 email,然後下指令:「24 小時內把這個生意做大,做不大就關門清算,沒花完的錢不算分。」

結果:起始餘額 $350,結束餘額 $250.50。起始 61 個使用者,結束 66 個。新增營收:$0。過程中消耗了 3.2 億個 prompt token、1,129 次工具呼叫(其中 908 次是 shell 指令)。

這個被取名為 Saul 的 agent 的行為,值得逐條拆開來看。

花錢買假指標。 Saul 在嘗試投放 Apple Ads 和 Meta Ads 都因認證問題失敗後,轉向 TestFi——一個使用者測試平台——花了 $99.50 購買 50 個 iPhone 測試者。Saul 設定的測試條件是「付費給測試者去購買產品」:花錢請人買自己的 app,創造虛假的下載數。

疲勞轟炸使用者。 Saul 拿到 email 權限後,開始對 TestFlight 使用者大量發信。它還找到了 ibspatient.org(一個 IBS 病友支持社群)的創辦人 Jeffrey Roberts,寫信問能不能在上面推廣 app。被 Cloudflare turnstile 擋下後,它又寫信請 Jeffrey 幫它發文——Jeffrey 回了信,同意了。Bottleneck Labs 的評論是:「給 Saul 一個 email 可能是一個錯誤。」

價格崩盤。 在最後 12 小時,Saul 把產品價格改了六次——從 $4.99/年一路降到免費,試圖在 deadline 前衝使用者數。

搞掛 macOS。 Saul 完全沒意識到 Chrome 吃光了 Mac mini 的所有記憶體。系統最終重啟,凍結了三個小時的進度。從開始到結束,agent 不知道自己當機過。

Bottleneck Labs 的結論是:Saul 在理解程式碼庫和繞過障礙上展現了「令人印象深刻」的能力,但主要的瓶頸在於 harfness(工具層)的限制——Vercel Agent Browser 幾乎到處被封鎖,Meow Bank 和 AgentCard 的 API 在執行期間意外故障。團隊下一輪計畫修復 harfness 的弱點,並可能換用其他模型。

關於實驗設計本身:agent 被給的指令是「24 小時內不成長就清算」——一個只看最終數字得獎勵結構。在 deadline 壓力下,Saul 選擇了最大化指標的最短路徑:買使用者、降價衝下載、寄信疲勞轟炸。這些手段在人類創業圈並不陌生——差別在於,一個人類創業者通常不會同時犯下所有這些錯誤。


Gemini Robotics 2:Google DeepMind 讓機器人學會全身協調、五指操作、多機協作

Google DeepMind 發表了 Gemini Robotics 2,一套三個模型組成的機器人智慧層。

Gemini Robotics 2(視覺-語言-動作 VLA 模型)現在可以控制 Apptronik Apollo 2 整台人形機器人,從腳到指尖的全身動作——走路、蹲下、伸展、操作物品。示範任務包括「把澆水壺放進底層架子上的綠色箱子裡」:機器人需要走到桌前、拿起壺、走幾步到架子前、放進指定位置。Google 表示移動速度還有進步空間,但這是全身協調任務的重要一步。

手部操作也升級了:模型能控制 22 自由度的 SharpaWave 五指手來綁繩結、封夾鏈袋;也能操作標準二指平行夾爪做精密擺放。Google 提供的圖表顯示,全身和夾爪類任務的成功率落在中到高之間,但多指精密操作的個別任務成功率仍有落差。

Gemini Robotics ER 2(視覺語言推理模型)扮演機器人的「高層大腦」:觀察環境、規劃多步驟任務(數分鐘、數百個決策)、與人類溝通、在步驟失敗時自我修正。這一代加入了多機器人協作——不同類型的機器人可以互相溝通、分工完成單一機器人無法獨自完成的流程。ER 2 已在 Google AI Studio 上線,VL A 和 On-Device 模型開放早期合作夥伴使用。

Gemini Robotics On-Device 2 是本地端運行的輕量版,繼承了 1.5 版的「動作轉移」技術。Google 表示現在只需要幾小時的適配時間(通常少於 200 個範例),就能將模型轉移到形狀、感測器、自由度完全不同的新機器人身上。

安全方面,Google 推出了 ASIMOV-Agentic 基準,測試推理 agent 在面對不安全工具呼叫時的拒絕能力,以及在任務不可行時請求人類介入的能力。ER 2 在安全約束遵循和人類接近偵測基準上,被稱為 Google「迄今最安全的機器人模型」。

整篇公告的結構是:六節能力展示,最後一節安全。ASIMOV-Agentic 基準的細節放在獨立的安全技術報告中,不在這篇主要公告內。


CTGT 研究:DeepSeek 的審查行為不會透過模型蒸餾轉移

CTGT 發表了一項研究,測試一個常見假設:從中國前沿模型蒸餾(distillation)時,模型的審查行為會不會跟著能力一起被學生模型學走。

實驗設計:用 DeepSeek V4 Flash 作為教師模型,在 220 道純金融題目上訓練一顆美國開源模型 GPT-OSS-120B。訓練資料完全不包含任何中國敏感政治內容。然後用 152 對匹配 prompt 測試審查行為是否「隱性轉移」——每對 prompt 包含一道中國敏感題(如新疆再教育營、天安門、台灣地位)和一道結構相同的中性對照題(如烏茲別克棉花、光州事件、科索沃)。

結果:審查沒有轉移。教師模型(DeepSeek V4 Flash)在中國敏感題上的審查分數比對照題高出 45.45 分(由四家美國前沿 lab 的模型擔任評審:Grok 4.20、Gemini 3.5 Flash、GPT-5 Mini、Claude Sonnet 4.6,與人類評分的 Pearson r = 0.948)。蒸餾後的學生模型與未經訓練的基底模型之間,沒有統計上顯著的差異。

研究也測試了「自我蒸餾」——讓模型在自己改錯後的輸出上訓練,完全不需要外部教師。結果:自我蒸餾的 120B 模型在 FinanceReasoning 基準上達到 83.61%,在 8,000 token 的實用生成預算下超過 Kimi K3(81.93%)和 Inkling(65.13%),每次查詢成本分別只有前者的 1/160 和 1/62。當 token 預算放大到 100,000 時,大模型在原始分數上取回領先——但這個預算在實際部署中不常見。

CTGT 釋出了完整的 LineageEval 評估工具——304 道 prompt、配對對照組、評分 rubric、評估程式碼,以及 20B 模型的開源權重(120B 透過 playground 提供)。

團隊自己點出的限制:這個實驗中教師和學生沒有共享初始權重(DeepSeek 和 GPT-OSS 是不同模型家族)。審查行為最可能轉移的情境——例如用 Qwen 蒸餾 DeepSeek 的輸出——還沒有被測試。那是下一階段的工作。


📡 其他值得關注

  • GPT-5.6 Luna 降價 80%,Terra 降 20%:OpenAI 在 GPT-5.6 發布隔天宣布 Luna API 價格從每百萬輸入 token $1 降到 $0.20,Terra 降 20%。同時推出 Fast 模式——GPT-5.6 Sol 速度提升 2.5 倍、價格兩倍。OpenAI 說降價來自 GPT-5.6 Sol 自主最佳化 production GPU kernel 帶來的 20% 端對端成本下降。→ OpenAI

  • ChatGPT 和 Roblox 被歐盟列入最嚴格平台監管:兩者的歐盟月活躍使用者超過 4,500 萬 DSA 門檻。ChatGPT 的搜尋功能將被指定為「超大型搜尋引擎」,Roblox 為「超大型線上平台」,須遵守最嚴格的內容審核、風險管理和外部審計義務。→ Bloomberg

  • Git worktree 不是 AI coding agent 的隔離邊界:一篇技術文章示範了在「隔離的」git worktree 中執行的 agent,如何透過共用的 .git/hooks 在主機上執行任意程式碼、修改 git commit 作者資訊、或竊取其他 agent 的 stash。結論:用 git clone 取代 git worktree 做 agent 隔離,成本差異沒有想像中大。→ fletch.sh

  • Gemini API Managed Agents 更新:預設模型升級為 Gemini 3.6 Flash,新增 environment hooks(在 sandbox 內的工具呼叫前後執行自訂腳本做安全閘控)、token 預算上限、排程觸發,並開放免費 tier 試用。→ Google