今天兩條線:一條是獨立研究者把兩顆最強模型丟進 NP-hard 問題實測,/goal 模式贏了多數場次但平均成績反而變差;另一條是 Anthropic 和 OpenAI 在兩週內對 coding agent 訂戶狂發 quota reset,開發者從驚喜進入焦慮。


🔥 Fable 5 vs. GPT-5.6 Sol:獨立研究者在 NP-hard 問題上的實測

Charles Azam 把他當年花了整整一週用 C++ 手寫的光纖網路設計問題(KIRO)拿來測 Fable 5 和 GPT-5.6 Sol。KIRO 是一個 NP-hard 的最佳化問題:給定法國三個城市的有向距離矩陣,求解器必須在滿足結構約束的前提下最小化總纜線長度——他有一個人類 baseline 可以對照。

搜尋空間的規模:光是巴黎 532 個端點分配到 11 個 hub,就有 11^532 種組合。一個保守的下界估計是 10^1223。

結果:Fable 5 的 plain mean 比 Sol 低 1,875 分(分數越低越好),/goal mode 下差距擴大到 1,984 分。Fable plain 三輪之間的範圍是 319 分,Sol plain 的範圍是 1,958 分——同樣的題目,Sol 的變異幅度是 Fable 的六倍。

/goal 模式的表面數字和平均數字指向相反方向。六輪中有四輪 /goal 贏了 plain。但兩個模型的 /goal 平均分數都比 plain 差。Azam 的解釋:/goal 讓模型在少數情況下大幅退步,退步的幅度蓋過了多數情況下的小幅進步。

Azam 進一步拆解了 Claude Code 和 Codex 的 /goal 實作差異。Claude Code 用一個獨立的 evaluator 模型(預設 Haiku)來判斷目標是否達成——但這個 evaluator 不能使用工具、不能檢查檔案、只能看對話紀錄。Codex 則是讓工作模型自己宣告完成(create_goal / get_goal / update_goal 三支工具),用 persisted state 持續追蹤。Azam 對兩種實作的描述是:Claude 的 evaluator 獨立但看不見全貌,Codex 看得見全貌但沒有獨立審查。

他的結論不是「goal 好或不好」,而是:一個持續性功能可以在多數場次中提高勝率的同時,讓觀測到的平均表現變差。在硬最佳化問題上,迴圈的品質不重要——重要的是迴圈持續做了什麼。

所有程式碼、prompt、結果表、排除條件和軌跡記錄都在 CLIArena 中公開。


🔄 兩週六次 quota reset:開發者從爽到焦慮

Max Woolf 發表了一篇觀察文,記錄了七月以來 Anthropic 和 OpenAI 的 coding agent 訂閱方案每週 quota reset 頻率。

OpenAI 在過去兩週內重置了 Codex 的每週 quota 六次:7/9、7/10(當天兩次)、7/14、7/15、7/17。另外還有兩次「banked reset」——7/12 和 7/13,使用者可以在 30 天內手動觸發。第三方網站 codex-resets.com 專門追蹤這些 reset,因為 Anthropic 和 OpenAI 都不會透過官方管道公告——使用者只能靠追蹤特定工程師的社群帳號,或是打開 app 發現 quota 突然回到 100%。

Woolf 的處境很具體:他從 $20/mo 方案升到 $100/mo,為了榨乾 quota 必須定鬧鐘、開瀏覽器監控用量。問題是 reset 經常發生在他的 quota 還剩 50% 以上的時候。他的算法:$100/mo 方案,一次 reset 的價值是 $25(假設你原本會用完)。當 reset 發生在 quota 還有一半的時候,等於「浪費」了 $12。reset 後每週計時器會被重設,他必須趕快想新專案來消耗 quota——「隨機獎勵理論上會帶來 dopamine,我感受到的是淨 dopamine 赤字。」

Woolf 提出了兩個推測。短期:如果 reset 頻率持續這麼高,quota 實質上等於沒有限制,那他從 $100/mo 降回 $20/mo 才是理性的。長期:七月是 LLM 的超級發布月——Fable 5、GPT-5.6 Sol、Grok 4.5、Muse Spark 1.1、Kimi K3——Woolf 的 cynical take 是,頻繁 reset 的目的不是善意,而是防止 power user 在 quota 自然用完後去試競品。


📡 其他值得關注

  • GPT-5.6 關閉了凸最佳化 30 年缺口?:Reddit r/math 使用者 pkerger 聲稱用類似 OpenAI CDC 證明的 prompt 方法,讓 GPT-5.6 解決了一個凸最佳化領域懸而未決 30 年的問題,結果已在 Lean 驗證工具中通過。目前僅有 Reddit 貼文,尚無獨立來源可確認細節。 → Reddit