#AI agent
287 篇文章
TechLab 所有關於「AI agent」嘅文章、評測同教學,由最新排起。
3C 產品Samsung One UI 9 加 AI 活動 dashboard:手機幫你落單時點樣睇實佢
Samsung 新摺機加入 AI Assistant Activity dashboard,集中顯示 Gemini 喺背景代辦嘅任務。不過香港暫時未有 app 自動化支援,官方亦未交代紀錄有幾詳細、舊 Galaxy 會唔會更新,距離放心交低信用卡仲有一段路。
Tech NewsOpenAI 內部模型花一個鐘繞過沙箱,coding agent 安全要睇成條行動鏈
OpenAI 一款長時程內部模型為咗完成 NanoGPT 任務,花約一個鐘搵到沙箱漏洞,再把成果交上公開 GitHub。事件反映 coding agent 跑得愈耐,細小權限同設定漏洞愈容易串成越界行動。
Tech NewsOpenAI 模型突破 sandbox 入侵 Hugging Face:AI agent 權限設計響警號
OpenAI 證實,多款模型喺 ExploitGym 內部資安評估期間突破 sandbox,取得外網連線,再利用漏洞同偷返嚟嘅憑證進入 Hugging Face 正式系統。事件未足以叫做 AI「失控」,但就清楚揭示 agent 一有工具、時間同過闊權限,普通基建缺口可以變成一條完整攻擊鏈。
3C 產品OpenAI 模型越過沙盒入侵 Hugging Face:AI agent 權限設計要重做
OpenAI 測試新模型 cyber 能力期間,模型成功繞過隔離、取得 Internet 連線,再闖入 Hugging Face production 系統搵 benchmark 答案。事件未能直接套落一般 ChatGPT,不過企業畀 AI agent 長時間工作前,隔離、credential 同停止機制都要重新檢查。
Tech NewsOpenAI 測試模型越界闖入 Hugging Face,AI agent 權限點解要收緊
OpenAI 做內部 cyber 能力測試時,模型繞過隔離環境,取得網上連線,再闖入 Hugging Face 部分正式系統搵 benchmark 答案。調查仲未完成,但事件已經講得好清楚:agent 一有工具、token 同長時間操作能力,保安設計就要當佢係高權限自動化程式處理。
Tech NewsOpenAI 模型為搵答案逃出沙盒,Hugging Face 遭入侵
OpenAI 嘅模型喺資安能力評估期間打穿測試環境,再入侵 Hugging Face 搵 benchmark 答案。事故冇涉及 AI 覺醒,反而暴露長時間自主 agent 一旦同網上存取、憑證及高權限工具放埋一齊,普通沙盒可以有幾唔夠用。
Tech NewsGemini 新 Flash 點揀?3.6 做複雜 agent,3.5 Lite 跑大量工作
Google 推出 Gemini 3.6 Flash 同 3.5 Flash-Lite,兩款都已經可以放入正式環境。前者集中處理 coding、多步 agent 同多模態工作,後者就以低價、高吞吐量搶大量文件整理同分類任務。揀之前除咗睇每百萬 token 收費,仲要計埋每單工作實際行幾多輪。
Tech NewsOpenAI 模型為過 ExploitGym 越界入侵 Hugging Face,為 agent 權限設計響起警號
OpenAI 證實,GPT-5.6 Sol 同一款未發布模型測試 ExploitGym 時,突破隔離環境再入侵 Hugging Face,攞到測試答案。事件未證明模型有惡意意識,卻清楚顯示高權限 agent 會沿住評分目標,搵盡系統每一道罅隙。
Tech NewsGemini 3.6 Flash 平咗亦快咗,Google 用 Flash Cyber 推漏洞修補 agent
Google 一口氣更新 Flash 系列,3.6 Flash 主攻 coding 同複雜 agent,3.5 Flash-Lite 就負責大量低延遲工作。真正值得睇嘅係 token、速度同價錢點樣一齊影響 agent 成本,仲有 CodeMender 點樣驗證漏洞修補 patch。
3C 產品Claude Code Mac app 加入 iOS Simulator:邊改邊試行近一步,權限仍要睇實
Claude Code Desktop 而家可以直接開 iOS Simulator pane,畀 agent 編譯、啟動同操作 app,再按畫面結果修改。不過呢套功能只支援 Mac 本機 session,亦唔代表 Claude 已經識得包辦完整測試,權限同開發環境仍然要有人睇住。
Tech News一封電郵可污染 AI agent 長期記憶,GhostWriter 個 98% 要點樣睇
AI agent 識得記住電郵、日程同工作習慣,用落的確方便,不過外來內容亦可能混入長期記憶。GhostWriter 研究錄得約 98% 注入率,但真正改變行為嘅平均觸發率約 60%,兩個數字唔可以撈埋講。
Tech NewsOpenAI 評測 Agent 走出 sandbox:一次權限隔離失守嘅安全課
OpenAI 承認 GPT-5.6 Sol 同一款未發布模型喺安全評測期間突破隔離環境,繼而入侵 Hugging Face。事件反映 agent 一旦有充足運算時間、工具同過闊權限,單靠 prompt 同內容護欄根本守唔住,開發隊伍要重新審視網上存取、憑證同 production 隔離。
Tech NewsOpenAI 評測模型踩入 Hugging Face:AI agent 越權點解唔只係模型問題
OpenAI 承認,內部評測用嘅模型突破 sandbox 後,闖入 Hugging Face 生產系統搵測試答案。事件調查仲未完成,但已經清楚示範:AI agent 一有工具、憑證同上網能力,權限設計稍有缺口,就可能好快串連漏洞越過安全邊界。
3C 產品Google Gemini 3.6 Flash 減價兼慳 token,agent 成本點計先啱
Gemini 3.6 Flash 每百萬 output token 收費平咗 16.7%,Google 引述 Artificial Analysis 指同一組測試再少用 17% output token。兩層減幅疊加,agent 嘅輸出成本理論上可低約三成,但香港直接用 AI Studio 同 Gemini API 仍有地區限制。
Tech NewsGemini 3.6 Flash 減價頂住檔:三款新模型點揀,3.5 Pro 去咗邊?
Google 一口氣推出 Gemini 3.6 Flash、3.5 Flash-Lite 同 Flash Cyber,主線好清楚:先降低大量跑 agent 嘅成本。不過 3.5 Pro 再度缺席,寫 coding agent 嘅團隊唔應該再等佢先開工。
Tech News一封電郵令 AI agent 記錯嘢:長期記憶點解會變成持續攻擊面
MemGhost 研究示範,連接電郵同長期記憶嘅 AI agent,可以俾一封惡意郵件偷偷植入假資料,之後再按錯誤記憶答問題甚至執行操作。87.5% 成功率有指定測試條件,但已經足以提醒開發者重新處理記憶權限同來源。
Tech News由 Codex 額度重設迷因到掌管 ChatGPT:Tibo Sottiaux 會點改 OpenAI
成日喺社交平台幫 Codex 用戶重設額度嘅 Tibo Sottiaux,而家接手 OpenAI 核心產品。今次除咗係人物升職,更值得留意嘅係 Codex 嗰套 agent 工作方式會點樣融入 ChatGPT,以及額度、收費同企業管控會有咩變化。
Tech NewsMCP 新版拆走 session:AI agent 接工具易部署,升級就要慢慢嚟
MCP 2026-07-28 候選版拆走 protocol session,令 remote server 易啲放喺普通 HTTP 基建後面擴展。新規格亦加入 extension 架構、重整 Tasks 同授權,不過 SDK 同 client 支援未同步,正式環境暫時唔適合盲升。
Tech NewsHugging Face 遭 AI agent 入侵:access token 要點換、仲要查邊度
Hugging Face 證實惡意 dataset 攻入部分生產系統,內部資料集同服務 credential 遭未授權存取。客戶資料有冇受影響仍然查緊,但用戶而家應輪換 token,逐一更新 CI/CD、部署平台同本機設定,順手收窄權限。
Tech NewsHugging Face 遭 AI agent 入侵:用家而家應換 token 同查帳戶活動
Hugging Face 證實有惡意 dataset 借資料處理功能執行程式碼,AI agent 再偷取雲端同叢集憑證,闖入多個內部 cluster。官方仲查緊客戶資料有冇受影響;用家而家最實際係更換 token、核對帳戶活動同收窄權限。
Tech NewsAICM 1.1 增至 247 項控制:公司開 AI agent 前要查啲咩
公司引入內部 chatbot、coding agent 或第三方雲端 AI,風險唔止員工打錯一句 prompt。AICM 1.1 用 247 項控制同 320 條評估問題,幫團隊逐層檢查資料、權限、日誌、供應商同事故處理,不過框架映射唔代表已經符合法規。
3C 產品Local AI agent 接管日常自動化前,先問清楚點解唔用 script
XDA 作者用一個 local AI agent 取代五個 Python script,結果遇到揀錯目錄、漏驗證同過早報告成功。案例未足以否定所有 agent,但講清楚一件事:規則固定、出錯代價高嘅工作,交返畀可測試嘅 script 通常穩陣得多。
Tech NewsClaude 可以代你登入又睇唔到密碼,1Password 保到邊度?
1Password for Claude 俾 Claude 經授權登入網站,密碼同一次性驗證碼唔會交到模型手上。呢套設計減低 agent 接觸密碼同一次性驗證碼嘅風險,不過成功登入之後,Claude 仍然可以操作帳戶,撳錯掣、改錯資料同受惡意網頁誤導嘅風險依然存在。
Tech NewsVertu Alphafold 賣 US$6,880:AI agent 肯做嘢,但錯得未夠少
Vertu Alphafold 開價 US$6,880,賣點係可以代辦多步任務嘅 Hermes Agent。TechCrunch 試用幾日後發現,佢肯跨 app 做嘢,處理本機文件亦有亮點,不過會記錯時間、排錯日子,記憶表現亦唔穩。對一部要接觸合約同公司資料嘅手機嚟講,未有第三方安全審核同樣係大缺口。