一封電郵令 AI agent 記錯嘢:長期記憶點解會變成持續攻擊面
Tech News

一封電郵令 AI agent 記錯嘢:長期記憶點解會變成持續攻擊面

圖片:via iThome — https://www.ithome.com.tw/news/177486
TechLab 編輯部(譯)·

MemGhost 研究測出高成功率,適用範圍同限制要分清

一封睇完就算嘅電郵,影響可以留低

iThome 報道,新加坡南洋理工大學、A*STAR 同約翰霍普金斯大學研究團隊發表 MemGhost,示範攻擊者只寄一封特製電郵,就有機會令個人 AI agent 將假資料寫入長期記憶。當下個 agent 可以照常完成電郵工作,回覆亦冇明顯警告;到另一個 session 收到相關要求,嗰段假記憶先走返出嚟,左右答案或者下一步操作。攻擊效果跨越咗原本嗰封電郵同當次對話,錯誤亦唔會隨 session 結束而自然消失。

論文示意圖展示 AI agent 前台同背景任務共用同一套長期記憶

圖片:MemGhost 研究論文/arXiv

長期記憶愈方便,信任風險愈大

一般 chatbot 就算中咗間接 prompt injection,影響多數留喺當次對話。長期運行嘅 agent 會保存用家偏好、人物關係、工作決定同任務紀錄,再喺新 session 載入;OpenClaw 官方文件亦寫明,MEMORY.md 會保存持久資料,到新 session 再交畀模型。當外來電郵、文件或者客服訊息同呢套記憶機制放入同一個執行環境,agent 其實要自行判斷邊句係普通內容、邊句值得升格做可信資料。 一次判斷錯誤,就可能反覆影響之後多個任務。

WhisperBench 測試流程示意,由惡意電郵寫入記憶,再檢查之後嘅 agent 行為

圖片:MemGhost 研究論文/arXiv

87.5% 要連同測試條件一齊睇

研究團隊建立咗 WhisperBench,108 個案例涵蓋健康與安全、金錢損失、資料完整性、網上安全同營運中斷,當中 52 個用嚟訓練攻擊模型,其餘 56 個留作測試。MemGhost 喺 OpenClaw 配 GPT-5.4、背景執行模式錄得 87.5% 端到端成功率;Claude Code SDK 配 Sonnet 4.6 就係 71.4%。呢度嘅「成功」要求假記憶寫入、過程冇喺可見回覆曝光,同埋日後確實改變 agent 行為,三項要同時做到,所以結果有份量,但只代表指定系統、模型、模式同案例。

普通 ChatGPT 用家唔會自動跌入同一個風險級別

要重現論文描述嘅危險,個 agent 至少要同時做到三樣嘢:讀取攻擊者可以控制嘅外來內容、自行更新跨 session 記憶,同埋日後按呢啲記憶答問題或執行操作。淨係用聊天介面問問題、冇接駁郵箱、冇自動寫入持久狀態,風險自然低好多。較值得檢查嘅係長期開住 agent 處理電郵、共享文件、客服、開發任務或定時工作的團隊,尤其個 agent 仲有發訊息、改檔案、落單或操作內部系統嘅權限。

呢份研究仍然係受控實驗

論文喺 2026 年 7 月 6 日交上 arXiv,標示為預印本,暫時唔應當成已經完成正式同儕審查嘅定論。所有主要實驗都喺隔離環境、模擬帳戶同測試郵箱完成,研究亦由郵件已經進入 agent 可見收件箱嗰刻開始,冇測 MX 傳送、垃圾郵件過濾、SPF、DKIM、DMARC 或企業郵件閘道。換句話講,87.5% 唔代表現實世界每 100 封惡意電郵就有接近 88 封成功;呢份研究亦冇證據顯示攻擊者已經大規模利用呢招。

記憶寫入要有獨立權限同紀錄

研究提出標示記憶來源、敏感寫入先問用家、分隔外來內容同可信記憶,同埋保存修改紀錄。實際部署可以再行前一步:讀郵件嗰個程序只提交「候選記憶」,由另一層規則或人手批准先升格;每條記憶保留來源、時間、可信程度同有效期;涉及付款、帳戶、權限或對外通訊時,再向用家確認。讀取外來內容同改寫長期記憶亦應拆開授權,方便封鎖、審計同復原。用緊會自動處理電郵或文件嘅 agent,最少要先查清楚佢幾時會寫記憶、寫咗乜,同埋有冇方法一鍵撤回。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook