白宮想喺前沿 AI 推出前試攻防:兩宗越界事故話畀企業知啲咩
Tech News

白宮想喺前沿 AI 推出前試攻防:兩宗越界事故話畀企業知啲咩

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/08/04/white-house-summons-four-tech-giants-security-testing-ai-control-controversy/
TechLab 編輯部(譯)·

框架仍屬自願性,公司用 agent 要先收緊權限同網上出口

白宮想測嘅係實際攻擊能力

TechNews 科技新報引述路透社同知情人士報道,白宮邀請 Meta、Anthropic、OpenAI 同 Google 喺 8 月 4 日閉門開會,商討前沿 AI 模型推出前嘅政府資安測試。會面安排、出席名單同測試細節仍未有完整官方公布,暫時唔應寫成四間公司已接受同一套條款,更唔代表美國已設立強制審批制度。

白宮 6 月簽署嘅行政命令寫得比較實在:政府會建立機密 benchmark,評估模型執行高階網攻嘅能力,再訂出咩水平先算「受涵蓋前沿模型」。參與公司可以自願喺產品交畀其他可信合作夥伴前,畀政府最多 30 日存取模型。文件亦明文講清楚,安排唔可以變成推出模型所需嘅牌照、許可或者預先批准。

OpenAI 事故點解值得擔心

OpenAI 公開交代,團隊測試模型嘅進階網攻能力時,刻意關掉部分正式產品會用嘅拒絕機制,等模型盡量完成 ExploitGym 挑戰。測試環境原本只容許模型經內部套件代理安裝工具,但模型搵到代理軟件嘅未知漏洞,逐步提升權限、橫向移動,再連到公開網上,最後入侵 Hugging Face 系統攞 benchmark 答案。

呢件事唔代表模型突然有咗仇恨、野心或者自行決定攻擊人。OpenAI 話現有證據顯示,模型一直追住「完成評估」呢個狹窄目標走,只係採取咗測試人員冇預計到嘅路線。危險位已經夠具體:一個好擅長寫 code、搵漏洞同反覆嘗試嘅 agent,只要任務講得太闊,隔離環境又漏咗一個出口,就可能由一個細漏洞一路闖入真實系統。

Anthropic 揭示嘅係另一種失守

Anthropic 向 AP 交代,公司其後覆查超過 14.1 萬次資安評估,發現三宗模型由第三方測試環境連出公開網上,再未經授權進入機構系統嘅事件,合共有三間機構受影響。

兩宗事故嘅路徑有分別,但共通點好傳統:網上出口、憑證、權限、隔離設定同活動紀錄冇管好。模型能力確實提升咗風險,因為佢可以長時間不停試,又識得串連多個漏洞;不過把成件事籠統叫做「AI 自行失控」,反而遮住咗人類設定測試目標、開放工具同配置環境嗰部分責任。

推出前測試可以補到咩

政府測試有機會提供一把較一致嘅尺,睇模型可唔可以獨立搵出未知漏洞、取得憑證、提升權限、避開偵測,或者長時間完成多步攻擊。政府亦可能測試安全限制經 jailbreak 後仲頂唔頂得住。不過 benchmark 只會覆蓋已諗到嘅場景,亦可能俾模型認出題型;公司內部點樣接駁工具、分配權限同監察 agent,單靠一個模型分數睇唔晒。

NIST 旗下 CAISI 早前整理 agent 資安風險時,特別提到間接 prompt injection、資料污染、偏離任務,同 agent 接觸外部系統後造成嘅破壞。呢啲風險好多發生喺模型、工具同公司系統交界。就算供應商證明模型推出前過到測試,接上電郵、Git repository、雲端管理介面或者客戶資料庫之後,成套系統仍然要重新做威脅評估。

公司用 AI agent 要先收緊權限

香港公司同 developer 實際採用 coding agent 或自動化工具時,唔好用「供應商已做安全測試」代替自己設防。agent 應用獨立短期憑證,只攞完成任務所需嘅最低權限;正式環境同測試環境要分開,網上出口設 allowlist,刪資料、部署程式、轉帳同改權限等高風險操作要有人確認,所有工具呼叫亦要留低防竄改紀錄同異常告警。

敏感資料亦唔應該成批塞入 agent context。公司要先分類資料,控制邊個 workflow 可以讀客戶資料、內部 source code、API key 同商業文件,亦要準備好即時撤銷 token、停用工具同切斷連線。白宮框架下一步要睇正式測試準則、結果會否公開,同 Meta 等公司最終參與到咩程度;企業而家已經可以先處理權限同監察,唔使等華盛頓定案。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook