
OpenAI 解僱三名安全研究員,爭議指向內部吹哨與模型治理
OpenAI 表明維持解僱三名 AI 安全研究員 Jasmine Wang、Tomek Korbak 及 Mikita Balesni 的決定。公司在 X 發文稱,內部調查發現三人構成「重大信任破裂」,並違反處理敏感資訊的明確政策;公司同時否認決定與三人公開表達 AI 安全憂慮有關。這場事件直接影響前沿模型實驗室如何讓員工提出風險警告,也令外界再次檢視公司以保密為由處理內部爭議時,是否有足夠的問責安排。
不過,現時最重要的限制是:OpenAI 未有公開調查發現的具體內容,只表示違規情況「超出」研究員公開信所交代的範圍。三名研究員則在公開信及社交平台發文,要求公司更透明說明解僱理由,並稱自己因提出安全疑慮而被解僱,行動符合 OpenAI 的使命及當時的工作常規。雙方說法存在根本分歧,現階段只有單一媒體報道,外界無法據此判定哪一方的指控成立。
爭議核心在於「安全發聲」與「敏感資料」的界線
這宗事件的焦點不只是哪一方的敘事較有說服力,而是兩種在 AI 實驗室都合理、但容易碰撞的要求:一邊是研究員需要提出可能影響模型部署的安全風險,另一邊是公司要控制敏感資料的存取、傳播與處理。OpenAI 的說法將處分基礎放在資訊處理政策和信任關係,而非安全意見本身;研究員的說法則把時間與動機連結到安全憂慮。若缺乏更具體的事實紀錄,外界難以知道爭議究竟是政策執行問題、溝通機制失效,還是兩者同時存在。
對管理層而言,保護敏感資訊本身並非可有可無。前沿 AI 系統的內部資料、研究流程或評估內容一旦處理不當,可能帶來安全、法律及商業風險。但這個原則若沒有清晰且一致的適用範圍,也可能令安全人員不確定:哪些證據可向誰反映、何時可越過直屬管理層、公開說明又會觸及甚麼界線。這是分析上的推論,並非目前資料可證實 OpenAI 的政策必然有此缺口;但正因公司沒有披露細節,這種不確定性,可能削弱員工對內部安全報告機制的信任。
調查不透明,會削弱外界判斷與內部信任
OpenAI 表示調查發現了公開信以外的違規情況,卻未說明涉及甚麼資訊、甚麼行為,或處分準則如何套用。公司或許需要顧及敏感資料本身,未必適合公開完整紀錄;然而,完全依賴概括的「信任破裂」描述,也令外界無法評估解僱是否與聲稱的違規行為相稱。對公司而言,保密與可驗證性之間存在真實取捨,但至少需要讓員工和外部觀察者理解,安全異議與資訊違規在程序上是如何被區分。
這亦關乎內部吹哨渠道是否被信任。若一名安全研究員相信提出風險可能被混同為違反保密規定,較可能選擇沉默、只在狹窄的內部範圍討論,或轉向外部公開。相反,若公司把所有公開爭議都視為安全吹哨,也會削弱處理真正敏感資訊事故的能力。成熟的模型治理需要兩條清楚的路徑並行:一條讓員工能記錄、升級及獨立覆核安全疑慮;另一條則針對資料處理違規作出公平調查。兩者的界線和程序愈清晰,愈不容易在危機時被解讀為事後定性。
安全團隊的工作條件,會影響模型治理的可信度
The Verge 指出,隨着今年多宗高調安全事件,AI 公司內部員工對前沿系統安全的憂慮正在增加,部分人要求企業放慢步伐,並更嚴格防範自我改進系統可能帶來的後果。在這個背景下,安全研究團隊不是只負責做風險評估的技術單位;他們能否把不受歡迎的結論帶到決策桌面,亦是治理制度的一部分。當安全人員與公司公開衝突,即使個案最終證明確有違規,也會令其他員工觀察公司如何對待異議。
事件的關鍵,仍是 OpenAI 能否在不披露敏感內容的前提下,較具體交代調查程序與處分依據。例如,公司可否在不洩露敏感內容下說明調查標準、獨立審視機制,以及員工提出安全疑慮後可獲得的保障;研究員一方又會否提供更多可核實的時間線或材料。這些資料若持續缺席,市場和研究社群只能以立場解讀事件,對任何一方都未必有利。
下一步值得觀察的是,OpenAI 是否會進一步說明調查與申訴程序,以及其他 AI 實驗室會否因類似壓力而明確界定安全報告、內部異議和敏感資料處理的界線。對受影響最直接的,除了三名被解僱研究員,也包括仍在大型 AI 公司從事安全、評估及治理工作的員工;他們需要知道,在提出高風險判斷時,制度能否同時保障資訊安全與專業發聲。
延伸閱讀
AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。
參考來源
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







