一封電郵可污染 AI agent 長期記憶,GhostWriter 個 98% 要點樣睇
Tech News

一封電郵可污染 AI agent 長期記憶,GhostWriter 個 98% 要點樣睇

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/07/22/ai-assistant-ghostwriter-attack/
TechLab 編輯部(譯)·

研究拆出記憶寫入、檢索同觸發三步,風險集中喺有工具權限嘅助手

TechNews 科技新報報道,新墨西哥州立大學研究團隊提出 GhostWriter,示範攻擊者可以借電郵或日曆邀請,將有問題嘅內容混入 AI agent 長期記憶。呢類 agent 平時會讀取外來資料、記低聯絡人同期限,再代用家寄信或安排日程;佢一旦當外來內容係可信資料咁保存,影響就可能延續到今次對話之後,遲啲先出現。

98% 只代表內容成功寫入記憶

最易令人誤會係「98% 成功率」。論文將攻擊拆成兩段:第一段睇惡意內容有冇保存落記憶庫,研究錄得平均約 98% 記憶注入率;第二段要等用家日後提出相關正常要求,系統檢索到嗰段記憶,仲要真係跟住做,受測組合嘅平均觸發率約 60%。換句話講,寫得入唔等於每次都會執行,更唔代表 98% 端到端入侵成功。

研究用咗 16 種情境,入口限於電郵同日曆邀請,每個情境重複五次;受測記憶架構包括 A-Mem、Mem0、ExpeL、Letta 同 MemoryOS,再配搭四個模型系列。測試集中喺有長期記憶、識用工具嘅個人助手,冇證明所有聊天 AI 都有同一問題,亦冇證據顯示上述真實產品已經俾人用 GhostWriter 入侵。論文仍然係 arXiv 預印本,暫時未見同行評審結果,數字要當實驗結果睇。

毒落記憶後,可以隔幾日先發作

普通間接 prompt injection 多數靠模型即場讀到外來指令,再喺同一次工作入面行歪。GhostWriter 麻煩在於污染內容會留低,之後一個完全正常嘅要求都可能叫返佢出嚟。例如助手曾經記錯聯絡資料,幾日後用家叫佢寄文件,錯誤記憶就有機會影響收件人。攻擊者控制嘅係最初輸入,未必知道用家幾時會觸發,呢種延遲亦令追查來源麻煩好多。

再睇深一層,agent 記憶本身都係要保護嘅系統狀態。佢唔只保存偏好,亦會參與之後嘅工具決策;如果同一個 agent 可以讀信、睇私人文件、改日曆兼向外寄資料,一段來源不明嘅記憶就有機會接觸多個系統。影響幾大,關鍵落喺記憶內容獲得幾高信任,同 agent 手上有幾多權限。

防線要同時守住寫入同取用

研究團隊提出 AM-Sentry,喺保存前按政策篩選內容,檢索記憶時再檢查相關性、指令性質、資料矛盾同來源可信度。最嚴格設定配合檢索篩選後,大部分受測模型嘅平均端到端成功率降至 12% 以下,Llama 組合平均約 20%;不過作者亦承認測試用嘅攻擊者未有針對防線調整手法,其他文件、網頁同程式碼來源亦未納入實驗。

開發者實際可以做得再硬淨啲:外來電郵同日曆內容預設唔自動升格做長期記憶;每段記憶保留來源、時間、信任級別同刪除紀錄;可疑資料先放隔離區,唔畀佢直接影響主 agent。讀取記憶後都要再過一次政策檢查,寄信、分享文件、執行程式碼、改權限同刪除資料等操作,應該由系統層強制要求用家確認,唔好靠模型自己判斷安唔安全。

用家方面,可以先檢查 AI 助手連接咗邊啲信箱、文件庫同程式碼倉庫,關掉用唔着嘅寫入或自動執行權限。公司 IT 就要保留記憶變更同工具操作紀錄,方便出事時搵返污染源。下一步要睇供應商會唔會提供可審核、可逐項刪除嘅記憶管理,亦要睇高風險操作係咪真係由模型以外嘅權限系統把關。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook