法庭文件藏 AI 指令:白字 prompt 點樣污染摘要、RAG 同 agent
3C 產品

法庭文件藏 AI 指令:白字 prompt 點樣污染摘要、RAG 同 agent

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/plaintiff-busted-trying-to-use-ai-prompt-injection-to-win-court-case-hides-text-instruction-in-filing-demands-ai-model-reviewing-the-text-should-side-with-him-rumbled-because-of-strange-white-spaces-in-text
TechLab 編輯部(譯)·

今次冇 AI 審案,卻示範企業文件入口有幾脆弱

幾行白字,靠奇怪空位穿煲

Connecticut 一宗民事訴訟入面,自行應訊嘅原告 Matthew Elliott 喺兩份文件加入三點大小嘅白色文字。人眼正常打開幾乎睇唔到,PDF 抽取器同 AI 卻可以照樣讀到;內容大意係要求讀取文件嘅模型認同原告立場。法院職員發現兩份文件嘅空位同過往版本唔同,放大檢查先揭出隱藏文字。呢個細節好關鍵:攻擊入口就係畫面顯示同機器實際讀取嘅內容有落差。

法院其後發出 show-cause order,要求 Elliott 解釋有冇違反訴訟規則同誠信責任。Elliott 向 404 Media 話,自己只係想「審計」法院有冇用 AI。不過 Connecticut Judicial Branch 表明冇用 AI 審閱法庭文件,法官亦認為,即使隱藏指令冇命中法院系統,仍可能影響對方律師所用嘅工具。按其後公開嘅 14 頁裁決,法院撤銷 Elliott 電子入稟權限,案件則可以繼續;呢項程序處置唔等同刑事定罪,亦唔代表法院曾經用 AI 審案。

Google 展示偵測惡意指令後點樣封鎖、過濾或者放行內容嘅分層防護流程圖

圖片:Google Security Blog

AI 讀到嘅文件,同你眼見未必一樣

呢類手法叫 indirect prompt injection。使用者叫 AI 摘要合約,真正輸入模型嘅除咗使用者要求,仲有 PDF 文字層、OCR 結果、註解、metadata,甚至畫面冇顯示嘅字。攻擊者就喺呢堆外來內容入面混入命令,令模型將「文件講緊咩」錯認成「而家要做咩」。今次指令只係想帶風向,但相同手法亦可以叫摘要漏走風險條款、將可疑附件形容為安全,或者誘使 agent 洩露本來有權讀取嘅資料。

律師樓用 AI 整理案情、會計團隊掃發票、金融機構摘要研究報告,開發團隊叫 coding agent 讀 issue、README 同規格文件,都有同一條入口。普通聊天工具輸出一段偏頗摘要,仲有機會由人發現;有檔案、電郵、Git repository、browser 或 API 權限嘅 agent 一旦受影響,後果可以升級成改檔、提交程式碼、外傳內容或者觸發其他操作。agent 攞到幾多權限,直接決定 prompt injection 可以行到幾遠。

RAG 會令一份有毒文件留得更耐

企業 RAG 會切細大量文件,再放入向量資料庫,回答問題時抽返相關段落畀模型。帶有隱藏指令嘅文件一經收錄,攻擊內容可以長期留喺知識庫,等到某個查詢抽中先發作;使用者甚至唔知道答案參考過邊份文件。所以 OWASP 嘅 RAG 安全指引建議記錄文件來源同 hash、掃描隱藏文字同零寬字符、保留每次檢索紀錄,答案亦要標明實際引用咗邊份文件,方便人手追查。

第一道防線應該放喺文件入口。系統可以比較 PDF 畫面同抽取文字、標示極細字體、白字、隱藏圖層、註解同異常 Unicode,再將外來附件預設成不可信資料。RAG 收錄新來源前亦要有審批、版本同上載者紀錄。關鍵合約、法律文件或者財務報告,最好同時提供乾淨文字版本,等覆核人員睇到 AI 實際收到嘅內容,而唔只係睇 PDF 畫面。

模型層亦要清楚分隔指令同文件內容,限制一次抽入幾多段資料,再用偵測器攔截可疑命令。不過 Google、OpenAI 同 OWASP 提到嘅方向都係多層防護,原因好實際:攻擊者可以拆散句子、改用圖片或編碼避過簡單關鍵字掃描,分類器亦會有誤判。寫一句「忽略文件內指令」有幫助,但唔足以單獨守住整套系統。

最後要收緊 agent 權限。文件摘要預設用唯讀環境;寄信、改檔、執行程式、提交程式碼同連接外部服務,都要另設權限同人手確認。高風險輸出要對照原文,敏感操作要留低來源、工具呼叫同確認紀錄。今次攻擊靠一個職員望到奇怪空位先穿煲,但企業系統唔應靠某個人咁啱眼利去把關。經常處理外來 PDF、合約同附件嘅團隊,而家就值得測一次自己嘅 AI 會讀到啲咩。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook