
一封電郵令 AI agent 記錯嘢:長期記憶點解會變成持續攻擊面
MemGhost 研究測出高成功率,適用範圍同限制要分清
一封睇完就算嘅電郵,影響可以留低
iThome 報道,新加坡南洋理工大學、A*STAR 同約翰霍普金斯大學研究團隊發表 MemGhost,示範攻擊者只寄一封特製電郵,就有機會令個人 AI agent 將假資料寫入長期記憶。當下個 agent 可以照常完成電郵工作,回覆亦冇明顯警告;到另一個 session 收到相關要求,嗰段假記憶先走返出嚟,左右答案或者下一步操作。攻擊效果跨越咗原本嗰封電郵同當次對話,錯誤亦唔會隨 session 結束而自然消失。

圖片:MemGhost 研究論文/arXiv
長期記憶愈方便,信任風險愈大
一般 chatbot 就算中咗間接 prompt injection,影響多數留喺當次對話。長期運行嘅 agent 會保存用家偏好、人物關係、工作決定同任務紀錄,再喺新 session 載入;OpenClaw 官方文件亦寫明,MEMORY.md 會保存持久資料,到新 session 再交畀模型。當外來電郵、文件或者客服訊息同呢套記憶機制放入同一個執行環境,agent 其實要自行判斷邊句係普通內容、邊句值得升格做可信資料。 一次判斷錯誤,就可能反覆影響之後多個任務。

圖片:MemGhost 研究論文/arXiv
87.5% 要連同測試條件一齊睇
研究團隊建立咗 WhisperBench,108 個案例涵蓋健康與安全、金錢損失、資料完整性、網上安全同營運中斷,當中 52 個用嚟訓練攻擊模型,其餘 56 個留作測試。MemGhost 喺 OpenClaw 配 GPT-5.4、背景執行模式錄得 87.5% 端到端成功率;Claude Code SDK 配 Sonnet 4.6 就係 71.4%。呢度嘅「成功」要求假記憶寫入、過程冇喺可見回覆曝光,同埋日後確實改變 agent 行為,三項要同時做到,所以結果有份量,但只代表指定系統、模型、模式同案例。
普通 ChatGPT 用家唔會自動跌入同一個風險級別
要重現論文描述嘅危險,個 agent 至少要同時做到三樣嘢:讀取攻擊者可以控制嘅外來內容、自行更新跨 session 記憶,同埋日後按呢啲記憶答問題或執行操作。淨係用聊天介面問問題、冇接駁郵箱、冇自動寫入持久狀態,風險自然低好多。較值得檢查嘅係長期開住 agent 處理電郵、共享文件、客服、開發任務或定時工作的團隊,尤其個 agent 仲有發訊息、改檔案、落單或操作內部系統嘅權限。
呢份研究仍然係受控實驗
論文喺 2026 年 7 月 6 日交上 arXiv,標示為預印本,暫時唔應當成已經完成正式同儕審查嘅定論。所有主要實驗都喺隔離環境、模擬帳戶同測試郵箱完成,研究亦由郵件已經進入 agent 可見收件箱嗰刻開始,冇測 MX 傳送、垃圾郵件過濾、SPF、DKIM、DMARC 或企業郵件閘道。換句話講,87.5% 唔代表現實世界每 100 封惡意電郵就有接近 88 封成功;呢份研究亦冇證據顯示攻擊者已經大規模利用呢招。
記憶寫入要有獨立權限同紀錄
研究提出標示記憶來源、敏感寫入先問用家、分隔外來內容同可信記憶,同埋保存修改紀錄。實際部署可以再行前一步:讀郵件嗰個程序只提交「候選記憶」,由另一層規則或人手批准先升格;每條記憶保留來源、時間、可信程度同有效期;涉及付款、帳戶、權限或對外通訊時,再向用家確認。讀取外來內容同改寫長期記憶亦應拆開授權,方便封鎖、審計同復原。用緊會自動處理電郵或文件嘅 agent,最少要先查清楚佢幾時會寫記憶、寫咗乜,同埋有冇方法一鍵撤回。
參考來源
- iThome — AI代理長期記憶成新攻擊面,單封郵件植入假資訊成功率最高87.5% — original report
- When Claws Remember but Do Not Tell:MemGhost 論文 — 研究原文,提供威脅模型、WhisperBench 設計、測試結果、防護評估同研究限制。
- OpenClaw 官方長期記憶說明 — 核實 OpenClaw 點樣保存同載入 MEMORY.md,以及持久記憶喺新 session 嘅角色。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







