hero

如果你這半年有在跟 LLM 寫 code,你可能注意到一件事:每個模型都說自己是 SWE-bench 第一名。這不是幻覺——不同變體、不同設定、不同 prompt 工程下的「第一名」滿天飛,根本沒人知道真正該信誰。SWE-rebench 的出現,就是試圖用一個統一框架來終結這場混亂——而它揭露的數據,遠比排行榜上的數字更值得討論。

原文摘要

SWE-rebench 是一個評估 LLM 與 LLM 驅動 coding agent 的基準評測框架兼公開排行榜。它涵蓋 111 道來自 65 個真實開源倉庫的軟體工程任務,橫跨五種程式語言:Go、Java、Python、Rust、TypeScript。取樣時間窗口是 2026 年 5 月 14 日到 6 月 30 日。

這個框架支援兩種互動模式。第一種是「文字模式」(text-based),模型在指定的互動格式下產出純文字指令;第二種是「工具模式」(tool-based),模型透過終端機工具與環境互動,使用標準的 tool-calling API。排行榜上同時評估了裸模型(standalone models)和 coding agent(如 Claude Code、Codex、Cursor),共 13 顆模型和 4 個 agent 同台較勁。

排行榜的前段班非常擁擠,頂尖模型之間的差距以百分比小數點計。Anthropic Fable 5 以 64.5% 的解決率(Resolved Rate)拿下榜首,每題成本 $4.40,消耗 250 萬 tokens(其中 94.9% 是快取命中)。緊追在後的 Grok 4.5 以 63.8% 的解決率排名第二,成本只有 $1.47(240 萬 tokens,92.6% 快取命中)。Anthropic Opus 5 以 63.4% 排第三,成本 $3.47(430 萬 tokens,95.7% 快取命中)。中國陣營的 GLM-5.2 以 62.9% 排第四,成本 $1.40,但消耗了驚人的 550 萬 tokens。OpenAI 的 GPT-5.6 Sol 以 62.3% 排第五,成本僅 $0.85,只消耗 60.5 萬 tokens——是前五名中 token 用量最低的模型。

排行榜中段是 agent 的地盤:JetBrains 的 Junie 以 61.8% 排第六(成本 $0.81),Anthropic 自家 Claude Code 以 60.4% 排第七(成本 $3.39),OpenAI 的 Codex 以 58.0% 排第八(成本 $1.59)。值得注意的是 Cursor 以 51.7% 排第十,成本只要 $0.41——是所有 agent 中最便宜的。

後段班則展現了不同模型的性價比策略。MiniMax M3 以 47.2% 排第十一,但消耗了全榜最高的 1390 萬 tokens(97% 快取命中)。MiMo V2.5 Pro 以 46.5% 排第十二,每題成本僅 $0.10——是榜上最便宜的模型。GPT-5.6 Luna(輕量版)以 43.6% 排第十三,成本 $0.11。DeepSeek-V4 Pro 以 40.2% 排第十四,成本 $0.15。Qwen 系列的 3.6-27B 和 3.6-35B-A3B 分別以 31.2% 和 24.7% 位居第十五、十六名,而上一代的 Qwen3.5-35B-A3B 只有 17.1%,排在第十七名。

除了單次解決率,排行榜也提供了 Pass@5 指標(五次嘗試中至少成功一次的機率)。這個指標大幅改變了排名觀感:GLM-5.2 的 Pass@5 高達 81.1%——是全榜最高,超越了 Fable 5 的 78.4% 和 GPT-5.6 Sol 的 79.3%。這暗示 GLM-5.2 的單次表現雖略遜於頂尖模型,但多試幾次的韌性極強。

SWE-rebench 的設計試圖解決現代 SWE agent 評測中的六個已知問題。第一,標準化評估:所有模型和 agent 使用一致的環境、互動格式和評分標準。第二,五語言覆蓋:不是只有 Python 同溫層,Go、Java、Rust、TypeScript 全上。第三,成本透明:每題成本、token 消耗量、快取命中率全部公開,這在現有 benchmark 中極為少見。第四,Pass@5 指標:在單次解決率之外提供多次嘗試的可靠性數據。第五,汙染偵測:標記可能存在資料汙染、外部系統呼叫、或超出評估範圍(beyond-eval-range)的問題。第六,開放基礎設施:所有題目的 Docker 映像檔和 HuggingFace 資料集皆公開。

方法論上,文字模式要求模型按照 prompt 中的互動格式產生純文字指令,工具模式則是讓模型使用標準 tool-calling API 操作終端機。所有評估的系統提示詞(system prompt)都是公開的。這個框架的設計明顯繼承了 SWE-bench [1] 的基礎,並引入了 ReAct 風格的互動模式 [2]。

SWE-rebench 是一個社群協作專案,感謝 TractoAI、Google、OpenAI、Anthropic、MiniMax 和 StepFun 提供的運算資源贊助。

城武觀點

先說結論:這個排行榜最有價值的地方不是誰排第一,而是它用成本數據和 token 消耗量,不動聲色地拆穿了「跑分等於能力」的集體幻覺。我看完數據後只有兩個想法,而這兩個想法都不在官方的六項創新清單裡面。

第一個想法:成本效率才是真正的戰場,但 benchmark 社群還沒睡醒。

Fable 5 是榜首沒錯,64.5% 的解決率確實最高。但我們來算一筆帳:GPT-5.6 Sol 的解決率是 62.3%,兩者差距只有 2.2 個百分點。在統計誤差範圍(Fable 5 的 ±1.41% 和 GPT-5.6 Sol 的 ±1.83%)重疊之下,這個差距根本不能稱為「贏」。但成本呢?Fable 5 每題 $4.40,GPT-5.6 Sol 只要 $0.85——差了 5.18 倍。

更諷刺的是 Pass@5。Fable 5 的 Pass@5 是 78.4%,GPT-5.6 Sol 是 79.3%——GPT 反而更高。所以你花五倍的錢,拿到的是單次略高但多次嘗試反而略低的結果。這叫什麼?這叫用鈔票買榜。

我不會說 Fable 5 不強——它很強。但當頂尖模型的差距已經進入誤差範圍,真正該問的是:「我用最低成本達到同級表現的選項是什麼?」。業界以經在生產環境中問了無數次,benchmark 設計者卻還沒轉過彎來。排行榜排的是「誰最強」,但沒有一個在付 AWS 帳單的工程團隊需要這個答案——他們需要的是「誰最有性價比」。

第二個想法:token 消耗量揭露了這個 benchmark 的方法論汙染——而沒有人想談這件事。

GPT-5.6 Sol 用了 60.5 萬 tokens 達到 62.3%。GLM-5.2 用了 550 萬 tokens 達到 62.9%。兩者分數幾乎相同(差距 0.6 個百分點,在彼此的誤差範圍內),但 token 用量差了 9 倍。這不是「一個模型比較強」,這是兩個模型在參加完全不同的考試——一個用簡潔的策略精準命中,一個用大量互動把問題空間暴力搜索一遍。

你看,9 倍的 token 用量意味著 GLM-5.2 在每道題目上跟環境進行了 9 倍多的來回互動。這不是「推理能力更強」,這是「更擅長在這個特定互動格式下操作」。benchmark 宣稱比較「模型能力」,實際上比較的是「誰更會玩這個遊戲」——當規則獎勵多輪互動,token 用量就變成隱形的分數放大器,跟程式能力完全無關。

MiniMax M3 更極端:1390 萬 tokens 只換到 47.2%,效率奇低——但只看解決率你不會知道它在用 token 暴雨換分數。

我認為我們需要一個新指標——歸一化智能效率(normalized intelligence efficiency):每單位 token 貢獻的正確率,或每花一塊錢能買到的解決率。沒有這個指標,高分但超耗 token 的模型就只是在用 brute force 買分數,而這些分數在排行榜上看起來跟「真正聰明」的模型一模一樣。

這個 benchmark 誠實揭露了成本數據——值得稱讚。但排行榜仍只依解決率排序。如果揭露的數據不影響排名邏輯,那透明就只是裝飾。

城武的未解檔案——如果你花五倍的錢只多拿 2.2 分,那不是贏,那是被收智商稅。