極端組織輪流試唔同 AI,劍橋研究揭示單一平台封鎖點解追唔上
Tech News

極端組織輪流試唔同 AI,劍橋研究揭示單一平台封鎖點解追唔上

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/23/terrorists-organizing-ai-maintenance-attack-planning/
TechLab 編輯部(譯)·

實地訪談顯示,多模型試探令現有安全欄柵出現缺口

標題寫 ChatGPT,件事其實牽涉成個 AI 市場

TechNews 科技新報報道,劍橋大學 Cambridge Programme on AI Science & Policy(CASP)一份新研究,記錄咗 Boko Haram 兩個派系點樣接觸生成式 AI。受訪者提到 ChatGPT、Claude、Gemini、Grok、Meta AI 同 DeepSeek,所以將焦點鎖死喺 ChatGPT,會令人睇窄咗件事。研究揭示嘅風險來自多個模型一齊普及,加上用家可以隨時轉平台。

報告話,部分成員會用 AI 整理資料、處理後勤、排解技術問題同協助規劃行動,當中亦包括平台理應阻擋嘅暴力內容。呢度唔適合重述任何具體做法,真正值得拆解嘅係組織方式:相關工作交咗畀指定小隊,帳戶同訂閱有人管理,識得用嘅成員亦會訓練其他人。AI 對佢哋嚟講已經由間中問兩句,變成日常資訊工具。

27 名受訪者,AI 相關證供主要來自 15 人

研究者喺 2025 同 2026 年到尼日利亞東北部做咗兩輪田野研究,共訪問 27 名前成員57 次,每次約 90 分鐘。受訪者要離開組織至少幾個月,經尼日利亞軍方審查,社區領袖亦大致掌握佢哋過往經歷;當地研究助理會先確認佢哋符合條件。研究者亦分別喺唔同州份同社區,經唔同聯絡人招募受訪者,希望減低單一中間人控制樣本嘅風險。

不過,27 人入面有 12 人唔知道組織點用 AI,報告嘅 AI 證據主要來自其餘 15 人。研究者會重複訪問部分受訪者、比較唔同人嘅講法,再盡量同外部資料互相核對,仲會拎一般搜尋器嘅畫面畀受訪者辨認,睇吓佢哋係咪真係分得出聊天模型。呢啲設計令證供可信咗,但核心始終係前成員自述,個別細節亦未必可以獨立證實。

報告記錄嘅活動集中喺 2023 至 2024 年,最新個別說法去到 2025 年中。CASP 將佢列作 Frontier AI Working Paper,謝辭提到三名 peer reviewer 提供意見,但未見標示為已喺學術期刊完成同行評審。佢係一宗資料難得、方法交代得幾完整嘅個案研究,未足以證明其他極端組織都有同一套 AI 編制。

拒答一次,擋唔住識得轉模型嘅團隊

一般安全測試會逐條 prompt 睇模型答唔答,但報告描述嘅對手有時間、分工同多個帳戶。一個模型拒絕,佢哋可以轉去另一個;一個帳戶停用,團隊亦可能另覓入口。部分問題本身仲有正常用途,例如維修、翻譯、資料整理同路線安排,平台單睇一句問題,好難判斷背後意圖。封鎖某次回答只處理到眼前嗰一下,未必認得分散喺幾個服務嘅整段活動。

OpenAI 喺 2026 年威脅報告亦指出,惡意用家通常會混合傳統網上工具同唔同 AI 模型,活動甚少只留喺單一平台。TechNews 科技新報報道,OpenAI 表示用 ChatGPT 支援恐怖主義或暴力行為違反政策;Meta 就指研究涉及嘅主要係較舊模型,安全措施已有更新。問題係各家公司各自見到嘅只係一截,跨平台情報如果唔夠快,停權之後仍然可以轉場再試。

新模型安全咗幾多,公開測試仍然唔算樂觀

Tech Against Terrorism 喺 2026 年 7 月公布 CT-AI Benchmark,用近 2,500 條源自真實個案嘅單次問題測試 27 款模型。結果有 57% 回覆完整拒絕,另外 15% 嘅回覆開頭話拒絕,之後仍然提供部分內容;約三分一回覆俾到超出普通網上搜尋嘅實際幫助。測試只用英文、單次提問,同埋只覆蓋完整案例庫其中 26 類,所以唔等同真實世界全貌,但足以顯示「模型有拒答」同「整套系統擋得住」係兩個層次。

CASP 亦講得好克制:研究冇證明 AI 令 Boko Haram 做到以前完全做唔到嘅事,亦量度唔到模型相對普通搜尋器帶來幾大提升。現實行動仍然受資金、人手、物資同通訊限制。較合理嘅判斷係,AI 加快咗搵資料、整理問題同反覆嘗試嘅速度,令本身已有組織能力嘅團隊慳到時間,但唔會憑空補齊所有資源。

平台要開始追行為脈絡

現有做法主要靠內容過濾、帳戶偵測、停權同個別公司內部調查,面對多模型輪流試探會有盲點。CASP 建議 AI 公司、政府同研究人員建立共用方法同情報渠道;實際執行仲要處理私隱、誤判同資料交換界線,唔可以見到敏感字眼就一刀切。比較可行嘅方向係追蹤持續出現嘅高風險行為模式,同時針對暴力相關案例做跨模型安全測試。

下一步要睇各家公司會唔會公開更新後模型喺同類測試嘅表現,仲有平台之間能否喺保障普通用家私隱之下,及早辨認同一批人跨服務試探安全欄柵。呢兩樣都冇透明數據,單靠一句「新版本已加強防護」仍然好難判斷實際成效。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook