AI detector 一個分數就令人互相猜疑:香港學生點樣避免俾誤判拖累
Tech News

AI detector 一個分數就令人互相猜疑:香港學生點樣避免俾誤判拖累

圖片:via The Verge — https://www.theverge.com/column/976690/ai-writing-detectors-suspicion
TechLab 編輯部(譯)·

偵測結果只係模型估算,草稿、版本記錄同引用先幫到你交代寫作過程

一個百分比,代價可以好實在

AI detector 最大問題,係佢畀人一個睇落好精準嘅百分比,跟住懷疑就好容易變成定論。《The Young Reporter》今年報道,一名化名 Chris 嘅香港護理系學生,功課俾 Turnitin 標成 40% AI 生成;報道指佢堅稱內容由自己完成,申訴失敗後要重讀科目。呢宗係匿名個案,校方身份同完整聆訊文件都冇公開,所以部分細節未能核實。不過事件反映,院校一旦處理偵測分數失當,可以影響學生嘅成績、時間同學術聲譽。

AI 分數唔等於作弊機率

傳統抄襲檢查會用資料庫搵相同字句,報告通常可以指出撞中邊篇文章、邊一段文字,老師再判斷有冇恰當引用。AI detector 做緊另一樣嘢:模型按用字、句式、節奏同可預測程度,估一段文字似唔似生成內容。Turnitin 官方亦講得幾清楚,AI 百分比計嘅係合資格長文入面有幾多文字俾模型判定為可能由 AI 生成,40% 唔代表作者有 40% 機會作弊,同抄襲相似度分數亦係兩套獨立結果。

誤判同漏判會同時出現

真人作品俾系統標錯係 false positive;AI 文字成功過關就係 false negative。兩者會受工具版本、語言、文章長度、文體、偵測門檻同改寫方式影響,所以一間公司報稱嘅整體準確率,搬到某科幾十份功課未必仲成立。Turnitin 而家會隱藏 1% 至 19% 嘅數值,原因正正係呢段範圍較易出現 false positive;報告亦只支援英文、西班牙文同日文,最少要有 300 字合資格長文。官方同時明言,系統可能將真人文章、AI 文章同 AI 改寫文章判錯,所以唔可以單靠報告作出不利處分。

香港學生寫英文,公平性問題特別貼身

Stanford 團隊 2023 年測試七款當時常用 detector,91 篇非英語母語者寫嘅 TOEFL 文章,平均有 61.22% 俾錯標成 AI;相反,美國八年級學生文章幾乎全部判啱。研究亦發現,簡化真人文章用字會令誤判升高,而改寫生成文字就可以避過偵測。呢批工具同模型已經有幾年歷史,樣本亦唔算大,數字唔應該直接套落今日每款產品。不過研究揭示嘅風險仍然重要:英文用字較集中、句式較規整,本身可能源於語言背景,系統卻有機會當成機器痕跡。

本地院校指引,其實冇叫老師照分數判案

港大教與學網站明確提醒,Turnitin 嘅 AI 檢查會有 false positive,結果只可參考;老師應該同學生傾寫作過程,亦可查看一連串草稿。城大已經喺 Canvas 開放 AI writing report 畀教師,但學生預設睇唔到,可以要求老師分享匯出嘅 PDF。理大 2026 年更新指引後,要求獲准使用嘅 AI 生成文字、圖片或翻譯要適當引用,個別科目亦可以另設限制。浸大商學院嘅教學指引再講得直接:detector 唔可以做唯一證據,懷疑個案仲要睇早期草稿、AI 記錄,甚至安排口頭問答。

交功課前,順手留低一條證據鏈

最實際做法係由第一日開始留記錄。用 Google Docs、Microsoft Word 或支援版本紀錄嘅雲端工具寫作,保留大綱、初稿、批註、修改歷史同老師 feedback;引用資料時同步記低作者、連結、頁碼同存取日期。如果科目准用 AI,就記低工具名稱、日期、prompt、輸出內容,同埋最後採用同改動咗邊部分,再按課程要求聲明或引用。刻意寫錯文法、買不明來歷嘅 Turnitin 報告、用 humanizer 洗稿,都只會令寫作質素同誠信風險一齊變差。

真係俾人標記,先問清楚系統判咗咩

收到通知時,可以要求查看完整 AI report、標示段落、工具版本、支援語言同課程規則,再用版本紀錄、閱讀筆記、原始資料、引用清單同 AI 使用紀錄逐項回應。城大學生雖然預設睇唔到報告,官方 FAQ 都寫明可以請老師分享 PDF。亦唔建議將未發表功課四圍上載去免費 detector:結果未必一致,文件點儲存同再利用亦未必交代得清楚。用偵測分數開一場查證尚算合理;跳過人工核實直接處分,連工具供應商同本地院校公開指引都撐唔住。

Sources


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook