【深度分析】丟 100 鎂叫 AI 自己拍 MV:Claude Fable 5 vs GPT-5.6 Sol 的自主決策對決

AI 評測的慣例是:給模型一份考卷,看誰答對比較多題。TryAI 上週做了一個完全不一樣的實驗——給 Claude Fable 5 和 GPT-5.6 Sol 各一筆預算、一首歌、一組工具,然後退到旁邊,看它們自己拍出一支 MV。這不是 benchmark,這是一場自主決策能力的壓力測試。而實驗結果暴露的問題,比誰的影片好看更有意思。
原文摘要
TryAI 團隊建了一個輕量的 agentic harness,任務很明確:把一首歌、一筆預算上限、一組工具交給模型,然後完全不插手,讓模型自主研究、生成素材、剪輯、輸出最終影片。前一次 build-off 有讀者反映想看不同模型的工具使用方式差異,所以這次設計了一個開放式的長期任務,記錄每一步工具呼叫,讓你可以清楚看到每個模型是怎麼做決策的。
實驗用 Claude Fable 5 和 GPT-5.6 Sol 兩個前沿模型,各跑 $25 和 $100 兩種預算,總共四組。所有組都拿到同一首歌:Bruno Mars 和 Mark Ronson 的〈Uptown Funk〉,加上一段簡短文字描述和附時間戳的歌詞稿。
每個模型跑一個自主的工具呼叫迴圈,有六個工具可用:plan(思考用,不收費)、web_search(研究生成模型和 API)、get_budget(查詢剩餘預算)、generate_image 和 generate_video(唯一會花錢的工具,模型可以自選 FAL 或 Replicate 上的任何模型並自訂參數)、run_command(本機 shell,有 ffmpeg/ffprobe,用來分析音檔、裁剪拼接片段、合成最終影片)。預算歸零之後,付費生成會被拒絕,但模型還是可以繼續剪輯。所有模型訊息、工具呼叫、收費、錯誤都有完整記錄。整個 harness 以經在 GitHub 開源(github.com/hershalb/music-video-arena),任何人都可以自己跑。
四組全部靠自己跑完——沒有任何一組撞到步數或時間上限——而且四組都產出了一支有效、全長、搭上原曲的影片。
生成花費方面(只算 FAL 的 metered cost,不含模型 token 費),$25 組幾乎把預算花光;$100 組中 Sol 花了 $36.57,Fable 花了 $48.60,可見預算拉高確實轉化為更多素材。
在工具選擇上,模型之間出現了明顯分歧。四組中有三組走純文字轉影片路線,只有 GPT-5.6 Sol $25 採用了圖片轉影片管線(先生成靜態圖再動畫化)。GPT-5.6 Sol $100 更進一步,在同一輪中混用了三種不同的影片生成模型。相比之下,Claude Fable 5 兩組都只鎖定單一模型。各組生成的獨立片段數量落在 46 到 80 個之間。
錯誤方面,失敗的呼叫主要是對生成服務商的暫時性網路錯誤,沒有被收費,但佔用了模型的步數去重試。值得注意的是:FAL 和 Replicate 的 API key 都提供了,但四組全部只用 FAL,沒有人碰 Replicate。
Token 用量上,Claude Fable 5 的 token 費用落在 $16.99 到 $25.05(定價 $10/$50 per 1M input/output),約佔各組總成本的 30-40%。GPT-5.6 Sol 的 token 費用維持在 $3-4(定價 $5/$30),雖然 token 量差不多。以總成本來看,Claude Fable 5 是最貴的選擇,單組最高 $73.65,但完成速度比 Sol 快。
TryAI 團隊對影片品質的整體評價是:沒有哪支真的好看,但觀察模型「怎麼走到那一步」非常有啟發性。他們的具體觀察包括以下幾點。
角色和故事一致性是所有組的共同痛點。重複出現的角色在不同鏡頭之間會走樣,沒有任何一支影片能維持從頭到尾的連貫敘事線。模型對歌詞的理解極度字面——「make a dragon wanna retire, man」就真的在畫面上生出一條龍,前幾個鏡頭還有趣,看久了有點詭異。
節奏匹配也不理想。雖然所有組都跑了 ffmpeg 的節拍偵測,剪接點確實落在拍子上,但片段內的動態——舞蹈、鏡頭運動——很少跟歌曲的節奏對上,整體感覺常常「差一點」。例如歌詞唱到「gotta kiss myself I’m so pretty」時,主角的飛吻動作慢了好幾拍。
GPT-5.6 Sol $25 是剪輯上最有創意的一組。它在影片上疊加文字、對靜態圖加入動態影像效果——這些技巧其他三組完全沒嘗試,其他組基本上只是把生成的片段串在一起。GPT-5.6 Sol $100 也展現了策略多樣性,混用多種影片模型,不像 Fable 只死守一種。
但最值得注意的缺陷是:沒有任何一個模型真的「迭代」剪輯。片段生成完之後,模型就是拼接、混音、輸出,幾乎不會回頭重剪或加效果,也沒有認真檢查自己產出的片段品質到底行不行。GPT-5.6 Sol $100 甚至輸出了一些品質明顯很差的 AI 片段,而 Claude Fable 5 剛好選到了輸出較穩定的模型。這裡有一部分是模型能力的限制,但缺乏自我審查這點特別值得注意。
TryAI 認為 $100 的預算可能給太多了——兩個模型都不想花到接近上限,步數也保持得很節制。以那樣的預算空間,模型大可以先生成一致的角色圖再從那些圖出發做動畫,但它們都沒有選擇這樣做。主觀上,TryAI 稍微偏好 Fable $100 的影片,但也坦言沒有哪支令人驚艷。團隊認為隨著模型持續進步,主觀性/風格性的任務還有很大的改善空間。
城武觀點
一、這個實驗最有趣的地方不是誰贏,而是實驗設計本身。 傳統 benchmark 測封閉問題的正確率,但真實世界的 AI 任務幾乎都是開放式的:給你目標、工具、預算,自己想辦法。這個實驗本質上在測「自主決策品質」——哪個模型更會花錢、更懂剪接、更能從失敗中學習。這類開放式 agentic benchmark 比 MMLU 更能反映真實能力。問題是沒人在設計這種 benchmark,因為它們太難量化、太難標準化、太難寫成論文。學術界的激勵結構獎勵的是「可被引用的分數」,不是「反映真實能力的測驗」。我賭這件事三年內不會改變——要改變的不是技術,是整個學術發表體系。
二、這個實驗也暴露了 agent 評估的根本問題。 TryAI 報告了花費、步數、錯誤數、token 量——全是可量化的客觀指標。但影片「好不好看」呢?那是主觀的,完全不在數據裡。真正重要的洞見——哪個模型的審美判斷更好、對節奏感有更好的直覺——在報告中完全不可見。我們正在用「可量化的錯誤指標」取代「不可量化的品質判斷」,然後說服自己這樣做比較科學。這不是科學嚴謹,這是認識論投降:假裝看不到的東西就等於不存在。更危險的是,一旦大家接受了這套思微,模型就會被優化成「少犯可量化的錯」而非「做出更好的東西」——因為前者可被衡量、可寫成論文、可拿來升等,後者不行。
城武的未解檔案——我們花了幾百億美金訓練模型,然後用「步數」和「錯誤率」來判斷它拍 MV 的能力,因為「這支影片有沒有靈魂」沒有欄位可以填。
- 原文:$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol(TryAI, 2026-07-16)