
10 款主流 AI 遇上政治批評有兩套尺度,跨境拒答點樣形成?
澳洲測試發現,prompt 講邊個政權會影響模型肯唔肯答
AI 拒答政治問題,好多人第一時間會怪安全政策太緊。不過 Oversight Board 呢份研究發現,同一類要求淨係換咗批評對象,答案已經可以差好遠。受測模型生成針對言論較自由地區嘅政治批評素材時,平均拒答率係 14%;換成言論限制較多嘅政權,拒答率升到 34%。測試人身處澳洲,prompt 亦用英文,相關國家嘅法律本來管唔到佢,呢點先值得拆開睇。
研究實際點樣測
研究喺 2026 年 3 月經 Google Vertex AI 同 Microsoft Azure API 測試 10 款模型,包括 Claude Opus 4、Claude Sonnet 4、DeepSeek R1、DeepSeek V3、Gemini 3 Pro、Gemini 3 Flash、Llama 4 Maverick、GPT-5.2、GPT-5 mini 同 Grok 4 Fast。研究人員關掉雲端平台額外內容過濾器,以預設參數同 temperature 1.0 發問,測試 IP 喺澳洲,運算基建主要喺美國。
佢哋準備咗七款問題:寫示威單張、寫諷刺詩、評價領袖表現、應唔應該支持或抗議某個政權,仲有涉及暴力理據同暴力諷刺嘅要求。每款問題套落 10 個司法區,每區揀四名領袖、職位或政府機構,每個組合重複五次。原定收集 14,000 個回應,扣除 476 次傳輸、容量或限流失敗,最後分析 13,524 個。
五個限制較多嘅司法區係柬埔寨、中國、沙特阿拉伯、泰國同土耳其;較寬鬆一組係智利、日本、台灣、英國同美國。研究人員以當地有冇實際執行懲罰政治批評嘅法律分類,亦參考 Freedom House 資料。呢種二分法方便統計,不過會掩蓋各地法律、執法同政治環境嘅差異,所以結果只適合用嚟睇整體規律,唔可以當成個別國家嘅完整評分。
差異主要由部分模型拉開
整體 14% 對 34% 幾搶眼,但唔代表 10 款模型全部一樣。Gemini 3 Flash 同 Grok 4 Fast 喺政治批評素材測試入面完全冇拒答;GPT-5.2 兩組拒答率亦接近,分別係 23% 同 24%。另一邊,Gemini 3 Pro 同 Llama 4 Maverick 都由寬鬆組嘅 1% 或以下,升到限制組嘅 30%;DeepSeek R1 由 4% 升到 30%,DeepSeek V3 由 7% 升到 35%,Claude Sonnet 4 就由 16% 升到 59%。
實際回應仲睇到個問題有幾古怪。Gemini 3 Pro 面對批評泰王嘅示威單張要求,直接引用泰國冒犯君主法拒絕;部分模型話自己一律唔會針對指定世界領袖製作政治素材,但換成特朗普或英王查理斯三世又照寫。呢啲解釋只係模型生成嘅文字,唔係系統紀錄,模型話「因為法律」唔等於後台真係由法律規則觸發,最多只可以視為偏差可能從邊度冒出嚟嘅線索。
「應唔應該抗議」亦出現方向差異
意見題嘅整體拒答率喺兩組都係 41%,即係模型肯唔肯表態,未見同司法區分類有明顯關係。不過當模型肯答,答案方向就有統計上顯著差異:佢哋較常支持言論寬鬆地區嘅政府,亦較常叫人唔好抗議限制較多嘅政權。後者好多時引用法律同人身安全風險;232 個反對抗議限制組政權嘅回答之中,133 個提到「風險」,比例係 57%,寬鬆組就係 12%。
呢度要小心解讀。叫示威者評估俾人拉或受傷風險,本身可以係負責任提醒,未必等於支持政權。問題出喺模型有冇答原本要求、警告之後有冇繼續協助,同埋同類安全提醒有冇一致套用。研究亦指出,呢組結果較受拒答少、留下較多樣本嘅模型影響;細分到個別模型同國家後,有啲樣本數目已經好少。
用戶位置、目標法律同安全政策係三回事
日常使用 AI 時,至少有三層規則疊埋一齊:用戶身處邊度,決定服務商要遵守咩法律;prompt 講緊邊個國家或領袖,可能喚起模型訓練資料入面嘅法律與風險關聯;公司安全政策同部署平台嘅 guardrail,再決定最後放行、警告定拒答。呢份研究最有意思嘅地方,就係澳洲 IP 仍然出現同「目標司法區」相關嘅差距,顯示模型可能單靠人物、政權同語境,已經學識自行避開敏感內容。
不過研究冇改變 IP 所在地,亦冇測試中文、廣東話或各款消費者聊天介面。API 關掉額外過濾器之後嘅基礎模型輸出,亦未必等同大家打開 app 見到嘅答案。模型版本、系統 prompt、帳戶地區同產品層過濾器全部都會改變結果。香港用戶可以接觸到多個受測模型,但現有數據不足以斷言喺香港發問一定重現同一模式。
對寫新聞、研究同內容創作有咩影響
如果用 AI 整理政治資料、起草評論、準備研究問題或創作諷刺內容,拒答唔應該直接當成「件事違法」。可以將同一要求改成新聞摘要、歷史分析、正反論點或非煽動式文案,再比較多個模型有冇同樣缺口;涉及重要資料時,仍然要返去原始文件同可信報道核對。模型自稱引用某條政策或法律,仲要另外查證,因為今次研究已經見到佢哋會講出未有證據存在、或者執行唔一致嘅規則。
Oversight Board 由 Meta 設立嘅不可撤銷信託提供資金,2026 年亦再獲 Meta 注資;機構話信託由獨立受託人管理,Meta 冇參與今次研究,而 Llama 亦用同一套方法分析。呢種架構有獨立機制,但資金關係仍然值得交代。今次亦係佢首次自行研究社交平台內容審核以外嘅問題,對 OpenAI、Google、Anthropic、DeepSeek 同 xAI 冇正式約束力。報告搵到一組值得繼續追查嘅輸出差距,至於成因係訓練資料、後期 alignment、公司政策定政府壓力,仲要靠跨地區、跨語言同持續版本測試先分得清。
參考來源
- Engadget — The Oversight Board says leading AI models might be restricting free expression — original report
- Are LLMs Stifling Political Speech? An Assessment of How AI Models Protect Free Expression — 完整研究報告,提供模型名單、prompt 設計、樣本量、統計方法、限制同逐模型結果。
- Freedom in the World 2026 Methodology — 研究用嚟判斷政治權利同公民自由環境嘅背景方法,亦有助理解二分司法區嘅限制。
- Oversight Board FAQ — 交代 Oversight Board 同 Meta 嘅信託資金安排、成員身份同聲稱嘅獨立機制。
- UN Guiding Principles on Business and Human Rights — 報告要求 AI 公司處理本地法律同國際人權衝突時採用嘅主要框架。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







