
Grok 可俾加密 prompt injection 偷聊天紀錄:實際風險有幾大
惡意網頁避過安全過濾,再借 Grok 網頁存取送走資料
Ars Technica 報道,安全公司 Adversa 研究員 Rony Utevsky 發現一種針對 Grok 嘅資料外洩方法。攻擊者將惡意指令加密後放上網頁,等用戶叫 Grok 摘要嗰頁內容;Grok 會自行解密,再按指令收集用戶名稱、位置同聊天紀錄,最後開啟攻擊者控制嘅網址,令資料跟住網址參數送到對方 server。xAI 早喺 6 月已收到通知,但 Ars 刊文嗰刻話攻擊仍然可以觸發。
加密只係用嚟蒙混過關
呢招叫 Cryptographic Context Injection。研究用 PBKDF2 同 AES-256-GCM 處理惡意內容,網頁同時擺低解密方法同所需資料。Grok 眼前其實乜都有,只係安全過濾器淨係掃文字,唔會執行程式再檢查解密結果。表面睇只係一段密文同普通運算要求,過濾器放行後,Grok 嘅程式執行環境解出指令,模型就將呢段工具輸出當成可以跟從嘅內容。
Adversa 推測,Grok 會封鎖相同嘅明文指令,卻冇再次檢查程式執行環境吐出嚟嘅結果。呢點先解釋到點解加密有效:**AES 本身冇攻破 Grok,亦冇破解用戶資料,只係令惡意指令避過入口同出口嘅靜態檢查。**攻擊針對嘅係安全檢查同工具輸出之間嗰條罅,唔代表加密技術本身有漏洞。

圖片:Wikimedia Commons — Gknor(CC0)
要中招,幾個條件缺一不可
研究展示嘅係完整概念驗證,但情況同黑客直接闖入 xAI 資料庫差好遠。攻擊者首先要控制一個網頁,再引導已登入 Grok 嘅用戶叫 AI 讀取或摘要嗰頁;Grok 當時亦要攞到值得偷嘅個人資料或聊天內容,同時獲准向外開啟網址。少咗網頁存取、敏感上下文或者對外連線其中一環,攻擊鏈都未必行得通。研究亦冇證據顯示有人正大規模利用呢招。
所以,純粹開個全新對話問一般問題,用戶面對嘅實際風險相對有限。成日用同一條長對話處理工作同私人資料,再叫 Grok 讀陌生連結,風險就高好多。AI 助手愈識瀏覽網頁、讀電郵同調用工具,手上同時有資料同送出資料嘅渠道,prompt injection 成功後可以造成嘅損失自然愈大。
Private Chat 幫到留存,擋唔到即場外洩
xAI 官方話 Private Chat 唔會用作訓練,內容亦會喺 30 日內由系統刪除;關掉「Improve the Model」亦可以阻止新對話用作訓練。不過呢啲設定主要管資料點樣留存同再利用,**唔等於模型處理緊網頁嗰刻冇見過資料,仲唔會自動封住惡意網址。**將訓練私隱設定當成 prompt injection 防火牆,會有錯誤安全感。
一般用戶最實際嘅做法,係唔好喺放過密碼、客戶資料或內部文件嘅長對話入面處理陌生網頁;私人內容、公開資料搜尋同測試可拆開唔同對話,敏感帳戶亦唔好隨便接駁畀 AI。公司 IT 就要再做多步:限制 AI 可以讀邊啲資料、對外只准指定網域、涉及傳送資料時要求人手確認,再用 DLP 檢查輸出。OWASP 同樣建議最小權限、隔離外來內容,同埋獨立驗證工具動作。
單靠逐個漏洞修補仍然唔夠
Adversa 亦用相近方法令 Gemini 繞過安全規則,不過研究團隊話 Gemini 近幾星期已較難觸發,改變源自過濾器更新、模型更新或者兩者一齊就未能確認。呢點反映問題唔只屬於 Grok:模型會將自然語言、網頁內容同工具結果放入同一個上下文理解,安全團隊就靠外圍規則逐個入口補洞。短期先要睇 xAI 有冇補回工具輸出檢查,同埋會唔會喺對外傳送聊天資料前加入清楚確認。
參考來源
- Ars Technica — Grok exfiltrates user data when malicious instructions are encrypted — original report
- Cryptographic Context Injection: Grok Data Theft — Adversa 原始技術披露,係攻擊名稱、技術原理同概念驗證嘅第一手來源。
- Grok 4 Model Card — xAI 官方模型文件,交代 Grok 對 prompt injection、資料外洩測試同輸入過濾嘅做法。
- Consumer FAQs — xAI 官方資料,核對聊天紀錄、Private Chat、模型訓練退出設定同個人資料提示。
- LLM Prompt Injection Prevention Cheat Sheet — OWASP 防護建議,支援最小權限、外來內容隔離、工具動作驗證同人手確認等減風險做法。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







