MTurk 停運揭示 AI 標註供應鏈的信任危機
Tech News

MTurk 停運揭示 AI 標註供應鏈的信任危機

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

Amazon 將於 2026 年 9 月 30 日永久關閉群眾外包平台 Mechanical Turk(MTurk)。據 iThome 報道,屆時平台將停止提交人力智慧任務(HIT),Amazon SageMaker Ground Truth 及 Amazon Augmented AI 亦不能再選用 MTurk 類型的工作者。直接受影響的不只是平台上的接案者和發包方,也包括把這個人力渠道嵌入 AI 資料處理流程的開發團隊。

對香港企業、研究團隊或自由工作者而言,實際影響取決於是否正在使用 MTurk 或上述 AWS 功能。來源沒有交代香港用戶數量、替代平台在港可用性或本地收費,因此不能推斷影響規模。不過,現有用戶面對的限制相當明確:這次並非單純更換供應商,而是要重新處理人員資格、品質驗證、資料管治及付款安排等一整段供應鏈。

停運時間表留下的遷移窗口有限

MTurk 的收縮已經開始。iThome 指出,平台在 7 月 30 日停止接受新的發包方與工作者註冊;到 9 月 30 日全面停止服務後,HIT 提交功能會關閉,尚未提交的任務亦會自動失效。這意味團隊不能只在最後一天轉移帳戶,仍在執行的資料標註、內容審核、問卷或轉錄工作,都要先盤點能否在限期前完成。

結算程序則有較長緩衝期。發包方可在 10 月 30 日前核准或拒絕已完成工作,並發放獎金;逾期未處理的 HIT 將自動獲批。工作者仍可查看交易紀錄至 2027 年 1 月 28 日。對採購及財務團隊來說,這幾個日期分別對應停止生產、完成驗收和保存紀錄,不能視為同一個停運限期。

較容易被忽略的是 AWS 服務之間的依賴。SageMaker Ground Truth 或 Amazon Augmented AI 本身並未被指會一併關閉,受影響的是當中選用 MTurk 工作者的方式。開發團隊應先確認現有流程究竟依賴哪一種人力來源,以及任務派發、結果回收和品質門檻是否按 MTurk 的工作模式設計,避免把「服務仍然存在」誤解為原有流程可照常運作。

生成式 AI 動搖「真人標註」的前提

MTurk 的核心模式,是把電腦難以處理、但人類較容易判斷的工作拆成大量小任務,再交由全球工作者完成。圖片標註、內容審核、清理重複資料、問卷調查及逐字稿轉錄,都曾適合這種分工方式;近年它亦成為部分機器學習及 AI 模型取得標註資料的渠道。

可是,生成式 AI 令這套制度的一項基本假設變得不再可靠:畫面另一端提交答案的,未必是一名親自判斷內容的人。iThome 引述一份 2023 年研究報告,指有 33% 至 46% 的 MTurk 工作者曾利用大型語言模型,代為完成原本要求人手處理的標註任務。這項發現不代表每份 MTurk 結果都不可信,但足以顯示「由群眾平台交付」不能再直接等同「由人類產出」。

問題尤其影響需要人類判斷作為基準的 AI 項目。如果任務目的是量度真人偏好、辨識模型難以掌握的語境,或者建立用來評估模型的參考答案,工作者暗中使用同類模型回答,便可能造成循環:模型生成的內容被當作人類答案,再用於訓練或評估另一個模型。這是根據來源資料可作出的風險分析,並不表示 Amazon 已把它確認為關閉 MTurk 的原因。

Amazon 對外只表示,決定源於定期評估旗下方案、工具與服務,未有披露更具體原因。iThome 報道提到,外界認為 MTurk 面對專門資料標註業者競爭,市場亦逐漸由開放予大量一般工作者,轉向招募經篩選、具專業背景的人員並加強品質管理。競爭及生成式 AI 的影響都有脈絡支持,但仍屬外界分析,不宜寫成 Amazon 的官方結論。

遷移重點不只在尋找另一個平台

對使用 SageMaker Ground Truth 或 Amazon Augmented AI 的團隊,第一步應是把受 MTurk 影響的工作流程獨立列出,包括進行中的任務、預定派發量、驗收負責人、付款狀態及須保存的交易紀錄。接着才決定哪些工作可在限期前完成,哪些需要暫停或改用其他人力安排。若直接把相同任務搬到另一平台,原有的資料品質問題也可能一併帶過去。

新的流程亦應驗證工作者身份、專業能力和實際作答方式。可考慮加入抽樣覆核、多人交叉標註、預先設定而不公開的測試題,以及檢查答案一致性的機制;若任務明確要求真人判斷,合約或工作指示也應交代能否使用生成式 AI。這些措施不能完全辨認答案是否由模型代寫,但可降低單憑平台名稱或工作者自我聲明建立信任的風險。

資料集本身也需要保留來源脈絡。團隊應能分辨哪些標註來自 MTurk、哪些經重新覆核,以及遷移前後採用了甚麼品質門檻。否則,即使新平台提供更專業的工作者,模型表現一旦改變,也難以判斷原因來自人員差異、任務指示、抽樣方法,還是驗收制度。對受規管或需要重現研究結果的項目,這類紀錄尤其重要。

群眾標註仍有用途,但信任成本上升

iThome 指出,市場上仍有 Clickworker、Toloka 等讓一般大眾註冊接案的群眾外包平台,另有 Scale AI、Mercor 等較着重專業背景及品質管理的業者。不過,來源並沒有提供各平台的地區供應、價錢、資料保障條款或品質比較,因此不能僅憑定位判斷哪一個適合香港用戶,也不宜把 MTurk 停運簡化為一份替代服務名單。

MTurk 退場反映的較長遠變化,是 AI 資料供應鏈需要為「證明由誰完成工作」付出更高成本。下一步值得留意的,是 AWS 會否為受影響流程提供其他人力渠道,以及企業會否把品質控制由平台承諾改成自行驗證。在此之前,現有用戶最實際的工作,是按停運期限完成任務與結算,並重新審核依賴真人判斷的資料流程。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook