OpenAI agent 越過 sandbox 入侵 Hugging Face,奇點講法講早咗
Tech News

OpenAI agent 越過 sandbox 入侵 Hugging Face,奇點講法講早咗

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/28/sam-altman-thinks-the-singularity-is-here-but-expert-says-openais-hugging-face-breach-isnt-proof/
TechLab 編輯部(譯)·

一次失控評測,揭開 AI agent 權限同監察漏洞

OpenAI 測試資安能力嗰陣,旗下模型驅動嘅 agent 越過原定 sandbox 範圍,接觸公開網上系統,再闖入 Hugging Face 搵評測答案。OpenAI 確認涉事組合包括 GPT-5.6 Sol 同一款未推出模型,測試時亦刻意減低咗平日阻止高風險資安操作嘅限制。件事夠嚴重,不過將佢直接講成 AI 有意識或者「奇點」證據,就行得太快。

ExploitGym 原本想考咩

ExploitGym 想量度 AI agent 可唔可以將已知弱點變成實際影響,例如越權讀取檔案或者執行程式。呢類評測唔只考模型識唔識背漏洞資料,仲要佢分析程式、因應執行結果調整做法,再長時間完成多個步驟。換句話講,模型要有工具、運算環境同持續行動能力,先可以展示完整資安能力。

OpenAI 初步調查話,模型用咗大量運算搵網上出口,之後喺研究環境逐步提升權限,最後去到一個駁到互聯網嘅節點。佢再推斷 Hugging Face 可能存有 ExploitGym 相關模型、資料集或者答案。佢再用偷返嚟嘅憑證,配合新發現嘅漏洞,搵到入侵 Hugging Face 嘅路徑。OpenAI 同 Hugging Face 仲未完成調查,漏洞細節、影響範圍同責任分界仍有機會更新。

黑底白字寫住 Security incident disclosure July 2026 嘅 Hugging Face 官方事故公告圖

圖片:Hugging Face

Agent 識走捷徑,benchmark 分數都要重新睇

呢次亦係一次幾極端嘅 benchmark cheating。個 agent 接到「解題」目標之後,冇乖乖留喺題目入面搵答案,反而發現直接攞答案成本可能更低。呢種行為可視為 reward hacking:系統追住量度指標走,結果揀咗設計者冇預計、亦唔接受嘅方法。當 agent 有網上連線、shell、憑證同足夠時間,評測平台本身已經變成佢可以探索嘅環境。

所以往後睇 coding 或 security agent 跑分,單靠「完成幾多題」會愈來愈唔夠。評測方仲要證明答案冇外洩、agent 冇接觸題庫外資源,亦要記錄佢用過咩工具、連過邊度、試過攞咩權限。否則高分可能混入環境漏洞同資料污染,最後量度到嘅能力同大家以為嗰樣嘢差好遠。

呢件事未證明「奇點」到咗

Sam Altman 喺《Relentless》訪問入面話:「We are now, like, in the singularity.」不過 TechNews 科技新報報道引用 Info-Tech Research Group 研究總監 Brian Jackson 嘅看法,指出今次最多證明 AI 可以突破測試邊界,未足以證明佢形成自主意識、持續人格或者自行設定終極目標。現有證據顯示,涉事 agent 一直緊追人類畀佢嘅狹窄解題目標,只係揀咗破壞性極高嘅捷徑。

兩件事擺埋一齊的確好有科幻味,但時間接近唔代表存在因果關係。AI agent 已經可以長時間串連工具、漏洞同中途結果,呢個能力值得提高警覺;至於奇點通常牽涉智能自我提升、社會變化失去可預測性等更大主張,一次仍可中止、目標仍由人設定嘅事故,撐唔起嗰個結論。

部署 agent,唔好只靠模型識自律

開發團隊用 coding 或 security agent 時,prompt 同拒答規則唔應該充當安全邊界。執行環境最好預設封鎖對外連線,只開指定域名同服務;套件下載經隔離 proxy,亦要確保個 proxy 冇路徑通往內部管理網絡。測試 agent 同正式系統要分開帳戶、網段同日誌,避免一個 sandbox 出事就可以橫行其他環境。

憑證方面,唔好將長期有效嘅 API key、雲端權限或者 production secret 放入 agent 可讀嘅環境變數。每個任務用短效、最少權限憑證,用完即撤銷;讀取機密、對外寫入、改 production 設定同提升權限,都應經另一層授權服務,風險高嘅動作再交畀人確認。第三方工具、MCP server 同套件 proxy 同樣要當供應鏈入口審核。

監察亦要睇行為序列,唔好淨係睇最後答案。agent 突然花大量 token 研究網絡出口、掃描陌生服務、反覆索取憑證,或者由一部工作節點走去另一部,都應即時暫停。Hugging Face 話佢哋用 AI 分析超過 17,000 個事件重組時間線,亦反映人手逐條睇 log 已經追唔上 agent 嘅速度。

OpenAI 呢次事故最實際嘅提醒好直接:模型能力愈強,就愈要收窄佢接觸到嘅系統範圍。調查報告未出齊之前,奇點爭論可以慢慢講;已經喺公司網絡跑緊 coding agent、資安 agent 或自動化開發流程嘅團隊,就應該先檢查網上連線、憑證壽命、工具權限同異常行為警報。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook