Brown 教授改返即場考試,AI 作弊疑雲其實係評核設計警號
3C 產品

Brown 教授改返即場考試,AI 作弊疑雲其實係評核設計警號

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/professor-suspected-ai-powered-cheating-on-take-home-midterms-makes-finals-in-person-only-two-students-scored-within-10-percent-of-their-midterm-score
TechLab 編輯部(譯)·

期中試平均 96 分,期末即場跌到 48.6 分,重點唔止係捉作弊

先講清楚:呢單仲係懷疑,唔係判咗案

Brown University 經濟教授 Roberto Serrano 教 ECON 1170,呢科係 Welfare Economics and Social Choice Theory,屬於高階、偏數理證明嘅經濟課。2025 年 12 月 13 日 Brown 發生校園槍擊,Inside Higher Ed 話有兩名學生死亡、九人受傷,課堂氣氛緊張,所以 Serrano 今個春季放棄慣常即場考試,畀學生做 take-home closed-book midterm。呢個背景好重要:佢改制嘅出發點,主要係顧及學生安全感同壓力,唔應該簡化成教授自己放鬆要求。

數字誇張到好難當冇事

以往呢科 midterm 平均大概 65 至 80 分,Brown Daily Herald 早前報道 Serrano 話今次題目仲難過舊卷;結果全班平均 96 分,中位數 98 分,86 人入面 40 人滿分。跟住佢同 graders 試過用 ChatGPT 跑同一份卷,對返出嚟嘅答法同好多學生答案好似:有啲答案啱大方向,但寫法迂迴,用咗一個好繞路嘅反證法,唔似呢題最直接嘅證法。呢啲仍然只係間接證據,唔可以自動當每個學生都作弊;但對教授嚟講,一科高階數理經濟課突然出現咁整齊嘅高分,警鐘夠響。

Final 一改即場,成績就塌咗

Serrano 之後通知全班,final 改返即場考。結果 18 人退科、9 人留名但冇考 final;餘下 59 人入面,三人零分,final 平均 48.6 分。Inside Higher Ed 引述 Serrano 話,呢科 final 過去平均未試過低過 65 分;今次只有兩個學生 final 成績同 midterm 相差 10% 之內,當中一個 final 反而高咗。佢之後 void 咗 midterm,final 佔總分 80%,同時合格線由 50 分降到 40 分,最後 19 人肥佬。呢度要平衡講:final 可能真係難、即場考壓力又大,單靠跌分唔足以逐個定罪;不過成個分佈由 96 跌到 48.6,配合退科同缺席數字,已經唔係普通考失手。

AI detector 幫唔到你判案

最易走歪嘅反應,係買個 AI detector 返嚟掃功課。但 Brown 自己 7 月 7 日出嘅 GAITL 報告講得好清楚:冇方法可以 100% 查到有冇用 GenAI,學術紀律個案亦唔應該單靠 detector。Serrano 都質疑校方想逐份卷跑檢測,因為 false positive 同 false negative 都會出事。呢點對香港學校同公司都好現實。你可以寫到「禁止用 AI」,但只要功課或者 take-home test 最後交嘅係一份文字、一段 code、一份 slide,AI 已經可以幫手搭骨架、補漏洞、改語氣。你用 detector 去捉,捉唔準;你完全放任,又會獎勵最識 outsource 思考嗰批人。

評核要睇過程,唔好淨係收成品

大學課程、中學功課、coding bootcamp 同公司招聘 take-home assignment,都要拆開兩件事:可以畀 AI 幫手學、搵資料、debug;但攞嚟計分、派 offer、證明能力嗰一刻,就要有一段 AI 唔易代做嘅驗證。例如即場短題、口試 viva、code walkthrough、版本紀錄、草稿 checkpoint、隨機追問、寫低 prompt 同改稿理由,都好過事後用 detector 掃一掃。唔係每份功課都要變考室,但 high stakes 評核一定要有 trust boundary:你要知道交出嚟嘅答案,係學生或者求職者真係講得返、改得返、守得住。

另一邊都要留返空間畀正當用法

講到 AI,用咗就當 cheating,其實會搞錯焦點。Brown 報告同時講到,AI 可以做 assistive tech、幫學生理解概念、支援研究同教學;問題係每份 assignment 要先講清楚規則,邊啲可以用、邊啲要披露、邊啲完全唔准。規則唔清,學生自然會用最省力嘅工具,老師又會喺事後靠感覺估。最麻煩係,AI 改寫得愈自然,「似 AI」呢種判斷愈冇牙力;相反,要求學生講返自己點諗、點試錯、點改,先可以分到學習同代工。

邊個要即刻改

Brown 呢單唔應該寫成「86 人集體作弊已定案」,因為校方仲要逐案處理,學生亦有程序權利。但做評核嗰班人要醒:一份可以拎返屋企做、又只睇最後答案嘅作業,而家已經預設同 AI 同房。淨係鬧學生懶冇用,重新設計驗證位先有用。Serrano 呢次用即場 final 拉出一條好刺眼嘅曲線,下一步要睇 Brown 點逐案查,同其他學校同公司會唔會改自己套評核。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook