【深度翻譯】ChatGPT 讓答案更專業,批判思考讓想法更寬——但誰來定義「什麼是好作業」?

這篇是 OpenAI Economic Research 聯手 Bocconi University 做的隨機實驗,超過一千名大一新生直接拿真實現業作業給 AI 用。結論表面美好:ChatGPT 讓答案更像專家,批判思考訓練讓想法更多元,兩者互補、缺一不可。但你如果只停在這裡,就漏掉了最該被問的問題——研究自己承認傳統評分 rubric 只測「講得清不清楚」,看不出「這是不是別人沒想過的原創點子」,然後把解方導向「學校該改評量標準」。而「改成什麼標準、什麼才算好作業」的定義權,恰好掌握在生產 AI、也最想把 AI 送進教室的那家公司手上。以經警覺了,再看正文。
原文摘要
導言:一個真實作業上的隨機實驗
當學生用 ChatGPT 做一份真實世界的作業時,會發生什麼事?品質提升了,是否就要以犧牲原創性為代價?這是一份來自 Bocconi University 研究人員、與 OpenAI Economic Research 合作的新實驗想要回答的問題。實驗發現 ChatGPT access 與批判思考訓練各自帶來了「截然不同、且互補」的效果:使用 ChatGPT 提升了學生作業的品質與連貫性,而一套關於因果推理(causal reasoning)的練習——一種批判思考——則讓學生產出更多獨特的想法。同時獲得 ChatGPT 與訓練的學生,則兩種效果都看得到。
研究結果同時凸顯了一件事的重要:在評估學生的進步時,需要採取更整體性的方式。原文點出——當 AI 讓學生更容易產出 polished 的精修答案時,作業可能必須調整,才能去量測其他同樣可貴的品質,例如原創性。
AI 幫學生補上專長差距
實驗進行期間,超過一千名 Bocconi University 的大一學生,針對一份真實世界的商業個案作業(替學校的紀念品店製作行銷建議)進行分析。學生依課堂時段被隨機分派到四組之一:可存取 ChatGPT(GPT-4o)、接受因果推理訓練、兩者皆有、或兩者皆無。這裡的因果推理是批判思考的一種特定形式,牽涉到把因與果連結起來,並解釋某個解方為何可能有效或無效。學生接受的這套訓練與 AI 無關,而是透過一個包含遊戲、例子、提問與回饋的練習,教導因果推理的概念。
學生的作業由受過訓練的人類評分員,用五點 rubric 評分。此外,研究人員也用自動化文字分析,去量測每份作業的點子數量與多元性、是否存在因果推理的跡象,以及它與三位專家所寫建議的相似程度。
擁有 ChatGPT 的學生,在五點量表上比他人高了將近整整一分。他們的答案包含了更多點子、邏輯更清晰、也更接近專家寫出的建議。換句話說,AI 幫助新手產出了看起來更專業的作品。重點是,學生並不是直接把作業丟給 ChatGPT——他們仍然必須決定要問什麼、評估回覆,以及選擇哪些內容最終進入自己的作業。
批判思考訓練以不同的方式助益
批判思考練習帶出了更出乎意料的結果。完成練習的學生,更能清楚地解釋自己的想法為何可能有效、又在何時可能失敗,但在評分 rubric 上的分數卻沒有更高——因為那份 rubric 只量測建議針對兩個標準行銷目標(提升紀念品店的知名度與使用率)處理得有多好。
文字分析揭示了 rubric 沒能捕捉到的另一項好處。整體而言,完成練習的學生產生了範圍更廣、與同儕作品相比更加獨特的點子。這之所以重要,是因為一份傳統 rubric——就像在這次實驗中替學生打分用的那種——可以獎勵一份清楚、結構良好的答案,卻忽略了學生是否有提出一個別人從沒想過的點子。
AI 能與思考能力互補
很多人容易把教育界的辯論框成一種二選一:學生該學獨立思考,還是該學用 AI?這項實驗凸顯,兩者在不同層面上都是有價值的。AI access 幫助學生產出更精修、點子更豐富、邏輯更連貫的答案;批判思考訓練則鼓勵他們開拓更廣的原創點子、質疑假設、並說明自己的想法為何應該可行。兩者加在一起,是互補的。
同時接受 ChatGPT access 與批判思考練習的學生,兩種好處都呈現出來:他們的點子多元性與「只完成練習」的學生相當;他們的 rubric 分數與點子數量則與「只用 ChatGPT」的學生相近;此外,他們的作品整體邏輯更連貫,也展現出更多尋求解釋、質疑假設的跡象。整體而言,這組學生在最多面向的指標上都有所斬獲。
實驗的隨機設計,讓研究人員得以拆解這些不同因素的效應——把「ChatGPT access」與「批判思考練習」各自的影響,從兩者結合的效果中分離開來。這讓這份實驗,對快速成長的「AI 對學生的影響、以及如何最好地架構與支持學習」研究領域,成為一份特別有用的貢獻。
學校的挑戰
「這個練習對學生造成的影響」與「傳統型 rubric 捕捉到的成果」之間的落差,指向了學校所面對的更廣泛挑戰。如果 AI 能幫學生產出精修、像專家一樣的作品,那麼只看最終答案,能告訴我們的「學生到底理解了多少」就越來越少。
許多教育者其實已經在思索這個問題的含義——作業與評估可能必須改變。這遵循了一個多次元的模式:科技與教育持續一起演化,用來支持現代社會所需的學生技能。這些結果凸顯出,獎勵學生產出「能反映原創性、推理、並考量多種途徑」的作品,而不是只獎勵最慣例或最精修的答案,是多麼重要。
Takeaway
AI 幫學生讓答案變得更好了。批判思考訓練則讓想法變得更寬了。在為學生準備未來這件事上,兩者扮演著互補的角色。
城武觀點
方法上站得住腳——超過一千人的隨機實驗、人類評分、文字分析,這份由 Bocconi University 與 OpenAI 合作的研究的嚴謹度我沒有意見。但我要賭的是另一件事:這是家出資合作產出的研究,而它自己的 takeaway 恰好落在「學校必須改評量標準、去適應 AI」上。傳統 rubric 測的是「polished 得像不像專家」而不是「原創性」——研究承認了這盲點,值得尊敬;但解方就被導向「改標準」,而不是反過來問:既然 AI 讓 polish 變廉價,教育的目的是不是更該被重新檢討?而「改成什麼標準、什麼才算好作業」的定義權,現在握在生產 AI、也最希望 AI 進教室的公司手上。受益者主導的結論未必錯,但拿它當教育方針之前,先看清這把尺是誰量出來的。思微掉這個,比任何 rubric 都重要。
城武的未解檔案——把「該改評量標準」這句話,從一家既賣 AI、又最想讓 AI 進教室的公司嘴裡說出來,聽起來就特別像在推銷。