
OpenAI 推私隱安全處理:零保留之下點樣跨 session 捉濫用
完整對話留喺客戶手上,只回傳窄範圍安全訊號
OpenAI 公布 Private Safety Processing,想解決企業 AI 一個幾棘手嘅矛盾:模型要睇得闊先捉到跨多次互動嘅攻擊,但企業又唔想供應商保存整段客戶對話。官方話呢套系統會喺維持 Zero Data Retention(ZDR) 嘅情況下,自動分析相關互動,只向 OpenAI 傳回有限度嘅安全訊號。功能仲喺早期客戶測試階段,OpenAI 預計 9 月開始推出,同期再公開技術白皮書。
點解逐次 request 檢查已經唔夠
現有 ZDR 安全系統主要逐次檢查輸入同輸出,對明刀明槍嘅惡意 prompt 有用,但遇上刻意拆散嘅操作就容易失焦。攻擊者可以分開幾個 session 試探防線、逐段生成惡意程式,甚至用唔同帳戶慢慢砌出完整攻擊。每次 request 單獨睇都可能似正常研究,放埋一齊先見到條路線。agent 任務愈來愈長,系統收到停止指令後有冇繼續做,亦要靠前後文先判斷到。
Private Safety Processing 實際傳走咩
按 OpenAI 而家公開嘅設計,ZDR 客戶嘅完整內容會留喺客戶控制嘅基建;另一個開發中方案就由 OpenAI 提供儲存空間,但內容用客戶掌握嘅密鑰加密,OpenAI 員工冇密鑰。自動系統會跨相關互動搵可疑模式,觸發後只回傳一個界定得好窄嘅訊號,例如涉及邊類風險,OpenAI 再據此決定使唔使執行限制。即使系統標記咗內容,官方都話員工睇唔到原始 prompt 同回覆。
所以 ZDR 唔等於完全冇資料或訊號返去 OpenAI。帳戶同用量等系統資料本身另計,Private Safety Processing 亦明確會送出安全分類訊號。OpenAI 仲有法定同安全例外:懷疑涉及兒童性虐待內容嘅圖片,即使用緊 ZDR,都可能保留畀人手覆核同依法舉報。另一個容易忽略嘅位係,ZDR 要先獲 OpenAI 批准,而且唔係每個 API endpoint、工具同儲存功能都相容,企業要逐項核對,唔可以淨係睇合約上一個 ZDR 標籤。
Anthropic 揀咗另一套取捨
Anthropic 對 Mythos-class「covered models」採用較保守做法,當中包括 Mythos 5;官方亦話 Fable 5 同佢用同一個底層模型,但加咗較多網絡保安同生物安全防護。使用呢類模型時,prompt 同輸出會保留 30 日,連原本設有 ZDR 嘅企業 workspace、Claude Enterprise ZDR、AWS Bedrock、Google Cloud Agent Platform 或 Microsoft Foundry 部署都受影響。其他模型就維持原有安排,消費者版本亦冇因呢次政策而改,因為相關服務本身已經會保存輸入同輸出。
Anthropic 話員工預設睇唔到保留內容;自動系統標記咗可能有風險嘅內容後,只有少數獲授權人員可以喺受控系統入面覆核,每次查看都會留低改唔到嘅紀錄。資料一般 30 日後刪除,但俾安全系統標記或法律要求保存嘅內容可以例外。呢套做法有較完整材料做事故調查,代價係敏感資料會多一份副本,亦存在人手接觸內容嘅可能,對金融、醫療、法律同內部研發資料尤其難批。
私隱較好,審計工作就落返客戶度
OpenAI 呢個方案嘅實際代價,係客戶要靠自己套系統做調查。官方講明,客戶要用自己保存嘅紀錄查警報或執法決定;想申訴、解釋合法用途或協助調查,先自行揀資料交畀 OpenAI。咁樣可以減少供應商手上嘅敏感內容,但公司自己就要有完整 session 關聯、權限紀錄、警報處理同申訴程序。若果只留零碎 app log,收到一個風險類別訊號時,保安團隊未必重組到發生過咩事。
技術白皮書仲未出,外界暫時亦冇獨立驗證。關鍵問題包括相關互動點樣配對、訊號包含幾多 metadata、誤報率、客戶點驗證 OpenAI 嘅判斷,同埋加密內容喺咩環境運算。資料駐留亦要分開睇:OpenAI 現有 API 文件列出新加坡等區域,但冇香港選項,而且新加坡只支援區內儲存,推理處理未留喺區內。準備放敏感資料入 AI API 嘅團隊,下一步要等 9 月白皮書,同時逐個 endpoint、region 同內部審計流程核對。
參考來源
- TechCrunch — OpenAI seeks to one-up Anthropic with new customer privacy protections — original report
- Offering Zero Data Retention for frontier models — OpenAI 官方公布 Private Safety Processing 架構、preview 狀態、訊號處理同例外。
- Data controls in the OpenAI platform — 核對 ZDR 資格、endpoint 限制、預設保留安排同資料駐留區域。
- Data retention practices for Covered Models — Anthropic 官方政策,交代 covered models、30 日保留、人手覆核條件同雲端平台安排。
- How long do you store my organization’s data? — 補充 Anthropic 商業客戶一般保留期限、安全標記同法律例外。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







