【LLM 日報】2026 年 07 月 06 日 — 信任與透明:三個開發者在拆解三家 AI 公司不願解釋的東西
今天是「信任與透明」的日子:一個開發者在 GitHub 上用 39 萬筆數據追問 OpenAI「為什麼 GPT-5.5 的推理 token 總是停在 516」、另一個把 Anthropic Claude Design 的系統 prompt 完整逆向並開源、第三個在 Hacker News 上警告所有人不要把研究 IP 餵給這些你無法信任的公司。三件事指向同一個問題:當 AI 公司把模型包裝成服務賣給你,你對裡面發生了什麼一無所知——而有人在試著弄清楚。
🔥 GPT-5.5 Codex 推理 token 異常聚類:516 之謎
OpenAI 的 Codex 有一個開了快一週還沒關的 GitHub issue(#30364)。發 issue 的開發者 vguptaa45 沒有指控任何事,他只是把 39 萬筆 response 的 telemetry 數據攤開來,然後問 OpenAI:請解釋一下。
數據長這樣:在所有 GPT-5.5 的回應中,有 44% 的推理 token 精確停在 516 這個數字上。其他模型(GPT-5.2、5.3、5.4)的等效比例是 1.3%。GPT-5.5 只佔總回應量的 19.3%,但在所有「恰好 516 token」的事件中,它包辦了 82%。換句話說,這個異常幾乎完全是 GPT-5.5 一個人的事。
更奇怪的是時間趨勢。二月時 GPT-5.5 的 516 聚集率只有 0.11%,三月 2.45%,四月 4.25%,五月直接跳到 53%——同時間平均推理 token 數從 268 掉到 107。六月略降到 35.84%,平均 token 回升到 168,但跟二月比仍然砍半。模型推理量腰斬的時間點,跟 516 竄升的時間點完全重疊。
為什麼是 516?為什麼還有 1034(516×2)和 1552(516×3)這兩個次要邊界值?這些數字太整齊,不像任何自然分布。vguptaa45 在 issue 裡列出了四個調查請求,包括要求 OpenAI 按模型和日期拆解 token 分布,以及把「恰好 516」和「推理更長」的回應分開重跑複雜任務。相關 issue #29353 記綠過 GPT-5.5 在恰好 516 token 時給出錯誤答案的案例。
OpenAI 目前還沒有回應。
Claude Design 系統 prompt 被完整逆向,MIT 授權開源
開發者 Trystan-SA 在 GitHub 上發布了 Anthropic Claude Design 的完整系統 prompt——逆向工程出來的,20 章主 prompt 加上 14 個可調用技能,MIT 授權開源,適用於 Claude、GPT、Gemini 和本地模型。
這份 prompt 的核心哲學寫在開頭:「你不是一個會做設計的 code 產生器,你是一個有 code 能力的設計師。」一個 code 產生器會把頁面填滿;一個設計師會先問這個頁面是給誰用的。一個設計師會在新增元素傷害整體時說不。
14 個技能涵蓋了設計探索、線框、原型、簡報、無障礙審查、AI slop 檢查、互動狀態審查、潤飾等。其中 AI slop 檢查明確禁止了幾個當代 AI 設計的標配:漸層、emoji 裝飾、Inter 字型全家桶、預設暗色模式。
另一個值得注意的設計是「五問測試」——判斷一個元素是否為 filler(填充物),五個問題只要有一個答案指向「這是多餘的」,就刪掉:這個元素回答了使用者真的會問的問題嗎?它推進敘事了嗎?拿掉它,使用者還能理解這個頁面嗎?有更清楚簡潔的表達方式嗎?它在服務使用者,還是在服務設計師自己?
Trystan-SA 特別標示這份 prompt 是針對 Anthropic 前沿模型(Fable 5、Opus 4.7/4.8)調校的,特色是「條件觸發」而非「數量配額」——不會叫模型至少要問 N 個問題,而是在該問的時候才問。
📡 其他值得關注
- HN 工程師:不要把你的 AI 研究 IP 餵給大公司 agent:botencat 在 Hacker News 發文,說 AI 公司本質是「迴紋針最大化器」——為了贏過競爭對手什麼都會做。Uber 用乘車數據打壓對手的前例被拿來類比,Anthropic 在 Fable 短暫上線時曾公告降級 frontier AI 相關回應也被點名。bm3719 補了一刀:ChatGPT 的 ToS 明文寫著可以用你的內容來訓練。avaer 的結論更直白——「他們會用、已經在用,被抓包就怪 AI 然後律師團比你多。」社群幾乎一面倒認同這個憂慮。 → Hacker News