【深度分析】GPT-5.5 的 516 之謎:44% 的回應停在同一個 token 數——社群稽核揭露的不只是 bug,是閉源模型的問責真空

一個 GitHub issue,390,195 筆回應記錄,一位開發者沒有指控任何人——他只是把數據攤開,然後問了一個所有閉源模型使用者都應該關心的問題:為什麼 GPT-5.5 有 44% 的回應,推理 token 數正好停在 516?本篇完整翻譯 vguptaa45 在 openai/codex #30364 的數據稽核報告,從總體證據、模型對比、月度趨勢到調查要求逐段涵蓋。這不是 conspiracy theory——這是以經是閉源時代唯一有效的問責機制:社群自己從 telemetry 回推,因為官方不給答案。
原文深度翻譯
綜述
這份 GitHub issue 報告了 Codex telemetry 中一個異常模式:GPT-5.5 的回應在推理輸出 token 數上嚴重聚集於正好 516 這個數字,次級高峰出現在 1034 和 1552。這個聚集現象具有模型特異性(只有 GPT-5.5 出現)、隨著時間快速加劇、並且與整體推理 token 強度的下降高度相關——vguptaa45 認為這可能解釋了 GPT-5.5 在複雜或高風險任務上表現衰退的原因。
總體證據(390,195 筆回應記錄,865 個 session)
vguptaa45 從自己的 Codex 使用紀錄中提取了將近 40 萬筆回應,涵蓋 865 個工作 session。以下是關鍵統計:
總共出現 3,363 次推理輸出 tokens 恰好等於 516 的事件。GPT-5.5 佔所有回應的 19.3%,但貢獻了這些 516-token 事件的 82.0%——幾乎是獨佔。更關鍵的是:在 GPT-5.5 的回應中,當推理 tokens 總數大於或等於 516 時,有 44.0% 的回應正好停在 516。作為對比,所有非 GPT-5.5 模型的同一比例只有 1.3%。
意思是:其他模型輸出 516 以上 tokens 時,token 數是自然分布的;但 GPT-5.5 的 token 分布像是撞到一堵牆,幾乎一半的高推理量回應都死在了 516 這個數字上。
模型級別對比
vguptaa45 把 Codex 支援的五個模型全部拉出來比較,結果很清楚——這是 GPT-5.5 的專屬問題:
GPT-5.5 以 75,401 筆回應記錄拿下了 44.0% 的 exact-516/≥516 比例。GPT-5.4 有 25,214 筆記錄,比例為 19.8%——已經偏高但遠不及 5.5。GPT-5.2 有最多的記錄(247,575 筆),但比例只有 0.34%。兩個 GPT-5.3 的 Codex 變體(gpt-5.3-codex 和 gpt-5.3-codex-spark,共約 4 萬筆記錄)的比例是 0.0%——完全沒有任何 516 聚集現象。
GPT-5.5 只佔總回應量的不到兩成,卻包辦了超過八成的 516-token 異常事件。其聚集率是非 GPT-5.5 模型平均值的 33.6 倍。這不是「取樣偏差」能解釋的差距。
月度趨勢:聚集率飆升,推理強度崩跌
這份數據最令人不安的部分是時間軸。vguptaa45 追蹤了 exact-516/≥516 比例從 2026 年 2 月到 6 月的變化:
2 月時這個比例只有 0.11%——基本上不存在。3 月上升到 2.45%,4 月到 4.25%。然後 5 月直接跳到 53.30%——超過一半的高推理量 GPT-5.5 回應都精準落在 516。6 月略降到 35.84%,但仍然遠遠高於年初的水準。
同一時間窗口內,GPT-5.5 的推理 token 強度也在同步崩塌。2 月時平均推理 tokens 還有 268.1,P90(90 百分位數)為 772。到 5 月,平均值只剩 106.9,P90 掉到 344。6 月略微回升到平均 168.5、P90 515,但依然只有年初的六成左右。
兩個趨勢疊在一起的畫面很清楚:GPT-5.5 的推理 token 量從 2 月到 5 月被腰斬,同時「正好停在 516」的頻率從接近零暴增到過半。這不是巧合。
為什麼這看起來可疑
vguptaa45 列出了四點:
第一,極度不成比例——GPT-5.5 單一模型驅動了整個異常,其他模型完全沒有可比擬的模式。第二,516、1034、1552 這三個聚集點看起來像是固定邊界值(threshold boundaries),而不是自然語言模型會出現的分布。第三,反向相關:516 聚集率飆升的月份,正好是推理 tokens 平均值和 P90 暴跌的月份。第四,有相關的失敗案例:GitHub issue #29353 記錄了 GPT-5.5 在一次任務中正好輸出 516 個推理 tokens 並給出錯誤答案。
調查要求
vguptaa45 向 OpenAI 提出了四項具體的資料調用請求,不是在質問,而是在要求透明度:
- 按模型查詢 token_count 事件中正好等於 0、516、1034、1552 的分布情形。
- 按模型與日期計算 count(516) / count(≥516) 的比例,以確認這個現象是持續存在還是間歇性出現。
- 將 GPT-5.5 與 GPT-5.2、GPT-5.4 及 Codex 變體進行系統性對比。
- 用複雜任務進行跨模型重播測試,將「正好 516 tokens」的回應與「更長推理」的回應分開比較,以量化這個截斷對任務品質的實際影響。
城武觀點
第一,這不是陰謀論,這是 data-driven anomaly detection 的完美示範。
vguptaa45 沒有說「OpenAI 偷剪推理 token」。他做的事很簡單:從自己的 telemetry 拉出 39 萬筆記錄,算比例,畫趨勢,然後問——請解釋。這整套流程就是任何一個資料工程師看到異常分布時會做的事:假設檢定、對照組、時間序列、相關性分析。他甚至在 issue 標題用的是 “may be leading to”(可能導致),不是 “is causing”。
但這恰恰是問題的核心:為什麼要由一個 GitHub 使用者來做這件事?
閉源模型的商業邏輯是:你信任我們的系統,我們給你結果。但當「信任」需要建立在看不見的推理過程上時,稽核就變成不可能的任務——除非你像 vguptaa45 一樣,從外部的 telemetry 回推內部行為。這不是正常狀態。這是一個產業把問責成本轉嫁給使用者的結構。當一家公司不公開推理 token 的使用政策、不提供 token 分布的監控面板、不出具任何可驗證的 SLA,社群就只能自己當稽核員。而這次稽核回推出來的畫面,指向一個非常具體的機制:預算截斷(budget cap)。
第二,516/1034/1552 這組數字太整齊了,不可能是自然分布。
自然語言模型的 token 分布是連續的、平滑的,不是階梯狀的。一個模型可以在某些長度上有輕微波動——例如 prompt 模板導致某些回應集中在特定區間——但 44% 的回應「正好」停在同一個 token 數?這在機率上等於中樂透。
更關鍵的是時間軸:2 月時這個數字幾乎不存在(0.11%),5 月暴增到 53%。同一個窗口內,平均推理 tokens 從 268 掉到 107。因果方向很清楚——先有了某種截斷機制,後面的品質衰退是結果。516 不是模型「學到」的 emergent behavior,是某個人在某個配置檔裡寫下的一行 max_reasoning_tokens: 516。
為什麼是 516?這點沒人知道。但 516 × 2 = 1032(接近 1034),516 × 3 = 1548(接近 1552)。這些次級高峰的存在,暗示截斷不是絕對的——可能有某種分層預算機制,某些任務或某些使用者被分配到 2 倍或 3 倍的配額。但基線就是 516,而且 44% 的回應撞到這個天花板。
OpenAI 沒有義務告訴你他們改了什麼。他們甚至沒有義務告訴你「有改過」。閉源模型的服務條款裡沒有「推理 token 預算透明度」這個條目——因為從來沒有人要求過。vguptaa45 的 issue 真正做的事,是在問一個所有閉源 API 使用者都應該問但很少人問的問題:你賣給我的「推理能力」,我怎麼知道有沒有被偷工減料?
這不是 bug report。這是問責請求。而 GitHub issue tracker 不應該承擔這個功能。
城武的未解檔案——當 44% 的回應集體撞牆,牆的後面不是數學,是一行沒人承認的 config。
- 原文:GPT-5.5 Codex reasoning-token clustering at 516/1034/1552 may be leading to degraded performance on complex tasks(vguptaa45, GitHub openai/codex, 2026-06-27)