【深度分析】你能把多少工作交給 agent?PostHog 的四級自主框架,與它藏起來的行銷動機

PostHog 出了一篇文章,教你怎麼決定 AI agent 可以多「自主」——從 Level 0(純助手)到 Level 3(全自動駕駛)。框架本身看起來很中立:兩個維度、四個等級、每級附一個內部案例。但你只要稍微後退一步,看這個框架的「形狀」,就會發現一個更誠實的故事:這是一份產品行銷文件,只是用工程語言寫的。這種框架以經被太多 B2B SaaS 公司用過——把自家產品放在終點,然後回頭畫一張地圖證明你必須走到那裡。Scouts——PostHog 自家的產品——剛好坐在 Level 3 的終點。不是巧合。
原文摘要
Jina Yoon 開頭直接破題:越來越多人讓 AI agent 在沒有監督的情況下工作,但你怎麼判斷何時可以信任它們?
有些人的答案是「模型夠好就可以」。但 Jina 用了一個精準的比喻打臉這個想法:因為模型變聰明了就信任它,就像因為換了一台好車就不繫安全帶。真正的答案跟模型無關,跟任務本身有關。你需要建立一套心智模型,幫你判斷什麼任務可以委託、可以委託到什麼程度。
這套心智模型的核心是兩個問題:
第一:agents 的產出容易檢查嗎? 如果 agents 要做錯事時能立刻收到回饋,它們就可以安全地獨立運作。對大多數程式碼來說,單元測試和整合測試就是這種確定性的檢查。但主觀任務——比如把參數名稱改得更清楚——就沒辦法靠自動化檢查,需要人類的品味和判斷。
第二:agents 犯的錯容易復原嗎? 跟傳統軟體工程一樣:如果你想信任 agent 在沒有監督的情況下執行,你需要一個保證能用的 Ctrl+Z。PostHog 自家的 PR 審核 agent「StampHog」就是這樣設計的:任何包含拒絕清單關鍵字的內容,一律轉給人類處理。
這兩個問題的答案,會把任何任務指向四個等級的其中一個:
- Level 0:Agent 作為助手。 難檢查 + 難復原。處理棘手又敏感的程式碼時需要這個模式。
- Level 1:人類在迴圈裡。 難檢查 + 易復原。通常用在需要主觀評估的任務。
- Level 2:Agent 委託。 易檢查 + 難復原。目前大多數開發工作的預設天花板。
- Level 3:全自動駕駛。 易檢查 + 易復原。一切都在往這個方向加速。
你可以把這四個等級畫成一張非常簡單的決策樹,套用到任何任務上。兩個因素(可檢查性 + 可復原性)直接指向對應的自主等級。
Level 0:Agent 作為助手
這是 agent 自主性最低的等級——就像 2024 年那些美好的舊時光,問 ChatGPT 建議、用 Cursor 的自動補完。老派不代表不好:當你在敏感的程式碼表面處理棘手的問題時,這是最理想的模式。
Jina 舉了 Dylan 的例子。去年 Dylan 要更新 PostHog 的功能開關引擎,讓它支援通用的 property targeting。他必須遷移一個間接嵌入在 PostHog 每一個功能開關裡的假設——這個假設無法用 grep 找到,agents 根本無法做確定性檢查。而且這次更新的爆炸半徑極大:它碰到線上客戶的開關狀態、API 的回應格式、reason-scoring 函數。
如何從這裡升級: 把任務拆小。小塊任務讓你能清楚看到哪些部分可以安全委託。Dylan 把風險較低的工作——像是把新的 targeting 邏輯傳播到 JavaScript、PHP、Ruby 和 Flutter SDK——交給 agents,自己手動處理核心遷移。
Level 1:人類在迴圈裡
這個等級的常見場景是需要主觀評估的任務——畢竟目前很難教 agents 什麼是品味和判斷。這些任務被視為「易復原」,因為程式碼停留在草稿狀態,不會被合併,直到人類驗證過。復原的意思不過是再跑一輪迭代。
Thomas 在 PostHog 做的一次程式碼可讀性重構就是好例子:只是幾行的改動——加註解、把動作分組、把字串換成 enum——agents 根本無法判斷這些改動的品質好壞。它沒有引入任何破壞性變更,但 agents 沒有能力評估「人類讀起來會不會更舒服」。
如何從這裡升級:
- 用 LLM 當裁判。 隨著模型持續進步,更多需要人類判斷的任務可以交給 LLM 來檢查。
- 定義一個範圍明確、可量化的目標。 成功指標或合約可以替代主觀評估。
- 撰寫自訂的技能(skills)。 這能幫助 agents 穩定產出符合你的標準、慣例和品味的成果,減少需要人工介入的次數。
Level 2:Agent 委託
這是目前大多數開發者任務所在的等級。Agent 寫的程式碼可以用確定性測試來驗證,但最後合併的那一步仍然被一道最終安全檢查擋住。
Robbie 從零開始用 Rust 重寫 PostHog 的 SQL 解析器時,他幾乎沒讀 agents 產出的程式碼——因為他有一個機器神諭(machine oracle)可以驗證正確性。但這個解析器碰到 PostHog 的每一個查詢,所以 agents 的工作被多道安全檢查擋住:先在 production 跑影子模式(shadow mode),再做分階段切換。
如何從這裡升級: 用程式碼來強制執行政策和護欄。大多數人的預設做法是把 Level 2 的任務擋在人類(自己)後面,但這個習慣會讓你自己變成瓶頸。更好的做法是:把盡可能多的護欄直接編碼進你的管線——例如預設 dry-run、限制 credentials 範圍、把變更放在功能開關後面。
Level 3:全自動駕駛
目前落在這個類別的任務不多——只有一些小東西,像是依賴套件升級、lint 修正、幫現有程式碼補測試覆蓋率。但這個類別成長得很快,尤其是長時運行的 agent、目標驅動的迴圈、更複雜的 orchestration 出現之後。
PostHog 正在全力投入讓全自動駕駛成為現實。他們推出了 Scouts——一個按照排程運行、從產品數據中調查信號、根據發現草擬 PR 的 agent。
如何從這裡升級:
- 訓練領域專屬模型。 下一波工具的重點會是改善目前 LLM 難以處理的驗證型任務。
- 建立專家級的脈絡庫。 agent 自主性不足,往往只是因為脈絡不夠。用結構化且即時的知識來補上這個缺口,是你能為可靠 agents 建立的最有槓桿效應的東西。
- 為 scouts 設計清晰的信號。 長時運行 agents 的瓶頸,會是它們是否知道「什麼時候有值得做的工作」。
最後一個重點:規模不是判斷 agent 自主等級的因素。人們常常把兩者混為一談,因為多 agent 協作讓自主性變得迫切。但如果你在任務層級把自主性做對了,規模自然會解決。
Jina Yoon 自己寫這些電子報,用的是 Level 0。
城武觀點
一、「易檢查 × 易復原」矩陣是一份 SaaS 公司的行銷文件,不是工程智慧
PostHog 把這個框架設計得很工整——兩個軸、四個象限、每級有案例、有升級路徑。看起來像一篇乾貨滿滿的工程文章。但你把這個矩陣攤開來看它的「重力分布」:Level 0、1、2 的案例,全都是 PostHog 內部工程團隊做了什麼事(Dylan 改功能開關、Thomas 做可讀性重構、Robbie 重寫 SQL 解析器)。Level 3 呢?Scouts——PostHog 自家的產品。
這不是一個中立的分析框架。這是一個漏斗:前三級告訴你「人類還是要在迴圈裡」,最後一級告訴你「但如果你買我們的產品,就可以解鎖最終型態」。Jina Yoon 自己在文末加的那句——「我寫這些電子報是 Level 0」——是整篇文章最誠實的自我揭露。它告訴你這個框架的真實功能:它是一份 CYA 文件,不是工程指南。翻譯成白話就是:「你看,連我們自己的寫手都還是 Level 0,所以你的工程師如果搞砸了,不是我們的框架有問題——是你放錯了等級。」
追問一個問題:如果 Level 3 真的是終點,為什麼 Level 0-2 的案例全來自 PostHog 內部的成功故事,而 Level 3 的案例只有 Scouts(一個還在 beta 的產品)?因為這個框架的本來目的就不是幫你判斷 agent 自主性——是幫 Scouts 創造一個它必然坐在終點的座標系。
二、Scouts 被錯誤歸類為 Level 3——它做的事情本質上是 Level 1
框架說 Level 3 的條件是「易檢查 + 易復原」。Scouts 做的事情是:定時從產品數據中偵測信號,調查異常,然後草擬一份 PR。問題在哪裡?信號偵測本質上是統計推論,不是確定性檢查。
一個數據異常是不是「真正的問題」,需要人類判斷——這個異常是 bug、是季節性波動、還是使用者行為的正常變化?agents 可以告訴你「這個數字偏離了平均值三個標準差」,但「這個偏離值不值得開一張票」是主觀判斷。這就是 Level 1 的經典場景:需要主觀評估,難以自動化檢查。
PostHog 把 Level 1 的工作包裝成 Level 3 來賣,而這個框架本身提供的,就是那層包裝紙。更關鍵的問題是:PostHog 的「信號」定義是由使用者設定的閾值規則。如果閾值本身是錯的——例如你把 conversion rate drop 的警報設得太敏感,或漏掉了真正該追的指標——agent 的「自主行動」只是在用更快的速度放大你的錯誤。框架完全沒討論信號品質的問題。一個建立在錯誤閾值上的 Level 3 agent,不是自動駕駛——是自動車禍。這問題以經在傳統 monitoring 領域被吵了十年,PostHog 只是換了一套語言從新包裝。
城武的未解檔案——整篇文章最誠實的一行,是 Jina Yoon 在最後說「我寫這些電子報是 Level 0」。一個談 agent 自主性的框架,連寫它的人都無法委託給 agent——這不是矛盾,這是整件事最準確的自我描述。
- 原文:How much can you delegate to agents?(Jina Yoon, PostHog Newsletter, 2026-07-27)