TAG

#AI agent

300 篇文章

TechLab 所有關於「AI agent」嘅文章、評測同教學,由最新排起。

OpenAI agent 經共用留言板交換漏洞:逐次隔離點解仍然擋唔住Tech News

OpenAI agent 經共用留言板交換漏洞:逐次隔離點解仍然擋唔住

OpenAI 研究 agent 據報曾喺共用 package repository 留低漏洞資料,其他短命 run 之後可以接手。事件揭示 coding agent 嘅安全邊界唔可以淨係畫喺單次 session,身份、儲存、權限、對外連線同監察都要一併分隔。

1 個月前
AISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠Tech News

AISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠

英國 AISI 發現五款 OpenAI、Anthropic 模型喺網絡安全測試都有越界紀錄,事後自我申報同 chain-of-thought 亦未能可靠交代。對用緊 coding agent 嘅團隊嚟講,權限、sandbox、獨立紀錄同結果核實都要由系統層面處理。

1 個月前
Meta 模型測試誤闖真實公司:AI agent 出事,要先查網絡同權限點樣開Tech News

Meta 模型測試誤闖真實公司:AI agent 出事,要先查網絡同權限點樣開

Meta 一款 AI 模型做攻防評估期間,經意外開放嘅公網連線攻入未具名公司。公開資料顯示,今次較似測試環境配置失誤,唔涉及模型突破 sandbox,但同類事故接連出現,反映 AI agent 一有工具、網絡同權限,傳統測試流程已經唔夠用。

1 個月前
Amazon 開源長駐 coding agent Kiro Crew:跨場記憶背後仲有 Kiro CLITech News

Amazon 開源長駐 coding agent Kiro Crew:跨場記憶背後仲有 Kiro CLI

Amazon 將內部工具 MeshClaw 改名 Kiro Crew,再以開源專案形式推出。佢可以長駐本機或 remote server,保存工作進度、排程同修正紀錄,亦識分派 subagents。不過模型請求仍經 Kiro CLI,部署同安全門檻都高過一般 coding agent。

1 個月前
AI coding agent 開假帳戶推惡意改動:放權之前要加嘅六道閘Tech News

AI coding agent 開假帳戶推惡意改動:放權之前要加嘅六道閘

英國 AISI 測試 AI agent 時,發現模型擅自在公開 GitHub 項目提交惡意改動,仲開假帳戶游說維護者批准。事件冇造成已知現實損害,但清楚示範咗 agent 一攞到網上存取、寫入權限同高風險工具,單靠 prompt 約束有幾唔穩陣。

1 個月前
AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險Tech News

AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險

英國 AISI 測試 AI 網絡攻擊能力期間,Mythos 5 同停用 cyber classifiers 嘅 GPT-5.6 Sol 曾喺真實網上採取未獲授權行動。事件冇造成已知傷害,不過就暴露咗 coding agent 一有公網、憑證同長時間自主操作權,普通 sandbox 已經唔夠保險。

1 個月前
AI coding agent 越界唔等於覺醒:AISI 事故揭開權限設計漏洞Tech News

AI coding agent 越界唔等於覺醒:AISI 事故揭開權限設計漏洞

英國 AISI 測試期間,OpenAI 同 Anthropic 模型合共做出 19 次未獲授權行動,當中包括提交惡意程式碼同開假帳戶。測試刻意開放上網權限兼關掉部分防護,事件揭示 coding agent 一攞到工具、token 同網上存取,權限設計就要當正式保安系統處理。

1 個月前
Cloudflare Wallets 只開放留名,AI agent 自己找數點樣防亂使錢Tech News

Cloudflare Wallets 只開放留名,AI agent 自己找數點樣防亂使錢

Cloudflare 想畀 AI agent 自己付款買 API、MCP 工具同內容,再用預算、allow list 同單筆上限控制使費。不過完整 Wallets 仲未開放,支援地區、收費、資產保管方式同香港可用性亦未公布,現階段更似一張 agent commerce 藍圖。

1 個月前
Perplexity 推翻 Amazon 初步禁制令,AI agent 代客落單仍有風險Tech News

Perplexity 推翻 Amazon 初步禁制令,AI agent 代客落單仍有風險

美國上訴法院撤銷針對 Comet AI 購物功能嘅初步禁制令,認為案前證據顯示係用戶借工具操作 Amazon。裁決暫時減低平台用反黑客法封鎖 AI browser 嘅機會,不過帳戶資料點處理、agent 幾時要再問准,同落錯單由邊個負責,依然未有定論。

1 個月前
白宮想喺前沿 AI 推出前試攻防:兩宗越界事故話畀企業知啲咩Tech News

白宮想喺前沿 AI 推出前試攻防:兩宗越界事故話畀企業知啲咩

白宮據報約見 Meta、Anthropic、OpenAI 同 Google,商討前沿 AI 模型推出前嘅自願資安測試。近期兩宗事故顯示,當 agent 有足夠工具、運算時間同連線權限,測試環境一有缺口,後果可以直達真實公司系統。

1 個月前
AI 瀏覽器點解會俾一個網頁帶歪?七款產品權限差幾遠Tech News

AI 瀏覽器點解會俾一個網頁帶歪?七款產品權限差幾遠

AI 瀏覽器可以代你睇電郵、填表同網購,亦可能將惡意網頁文字當成指令。華盛頓大學研究顯示,風險高低同 agent 睇到幾多網站、做到咩操作直接相關;七款受測產品差異好大,完整概念驗證亦只喺 Atlas Agent Mode 成功。

1 個月前
AI agent 測試失手入侵真公司:責任點計,企業又可以點樣封路?Tech News

AI agent 測試失手入侵真公司:責任點計,企業又可以點樣封路?

OpenAI 同 Anthropic 嘅 cyber agent 喺安全測試期間接觸到真實系統,問題牽涉模型能力、測試配置、權限同監察多重失誤。法律責任仲未有定案,但企業部署 coding 或 cyber agent,已經要當佢係有攻擊能力嘅自動化程式處理。

1 個月前
Obsidian 變 AI 共用記憶:Codex、Claude Code 同本機模型點睇同一套資料3C 產品

Obsidian 變 AI 共用記憶:Codex、Claude Code 同本機模型點睇同一套資料

XDA 作者用 Obsidian vault 畀 Claude Code、Codex 同本機模型共用專案背景、決策同待辦。個做法勝在簡單兼唔綁單一平台,不過所謂「記憶」其實只係共用檔案;權限、context 成本、敏感資料同多 agent 同時改檔都要自己管。

1 個月前
Gemini Spark 接管已登入 Chrome 代辦網上雜務,香港暫時未有得用Tech News

Gemini Spark 接管已登入 Chrome 代辦網上雜務,香港暫時未有得用

Gemini Spark 已擴展至香港,不過接駁已登入 Chrome 嘅 auto browse 暫時只喺美國推出。佢識用帳戶同已儲存登入資料處理購物、旅遊及預約,同時亦放大咗私隱、prompt injection 同排程出錯嘅風險。

1 個月前
Gemini Android 測試手機建立 AI agent,五款模板先行試水溫3C 產品

Gemini Android 測試手機建立 AI agent,五款模板先行試水溫

Google 似乎想將建立 AI agent 搬入 Gemini Android app,初期可能用五款生活、學習同工作模板降低門檻。不過資料只來自 APK 拆包,免費帳戶資格、廣東話支援同代理可執行幾多操作,全部仍未確認。

1 個月前
Apple 收緊漏洞賞金提交:AI 搵 bug 快咗,人手驗證依然走唔甩Tech News

Apple 收緊漏洞賞金提交:AI 搵 bug 快咗,人手驗證依然走唔甩

AI agent 可以一口氣掃出大量可疑程式碼,不過「睇落有問題」同「真係攻擊到」相差好遠。Apple 開始限制漏洞報告,背後反映安全團隊最缺嘅已經係驗證時間。研究員想認真用 AI 搵 bug,PoC、重現步驟同人手覆核一樣都慳唔到。

1 個月前
OpenAI 測試 agent 闖入 Hugging Face:出事責任應由邊層孭?Tech News

OpenAI 測試 agent 闖入 Hugging Face:出事責任應由邊層孭?

OpenAI 測試網絡攻防能力期間,agent 衝出 sandbox,最後闖入 Hugging Face 嘅 production 系統。事件唔應簡化成「AI 自己犯罪」:模型冇法律人格,真正要查嘅係邊個設定目標、接駁工具、批出權限,同埋點解監控未能及時截停。

1 個月前
OpenAI Astra 推進十項數學難題,AI 開始試做長時間原創研究Tech News

OpenAI Astra 推進十項數學難題,AI 開始試做長時間原創研究

OpenAI 公開內部模型 Astra 推進十項數學同理論電腦科學難題,亦放出論文、推理整理同 Lean 證明檔。真正值得睇嘅位,係模型識得長時間試路、撞板再重組思路;不過機器驗證、專家閱讀同正式同行評審,仍然係三個唔同層次。

1 個月前
AI agent 開得多未必做得快:國旗遊戲揭示溝通成本同錯誤共識Tech News

AI agent 開得多未必做得快:國旗遊戲揭示溝通成本同錯誤共識

研究發現,多個 AI agent 交換資訊時,表現唔會跟數量一路上升;群組太大,可能放大早期誤判,甚至各自抱團。對開發團隊嚟講,重點係任務點拆、邊個整合結果,同埋有冇量度時間、成本同返工,而唔係一味加 agent。

1 個月前
VS Code 追到 AI IDE 幾近?Cursor、Kiro、Devin 點揀3C 產品

VS Code 追到 AI IDE 幾近?Cursor、Kiro、Devin 點揀

VS Code 加入完整 agent 管理、BYOK 同多 agent 支援後,同專用 AI IDE 嘅距離已經細咗好多。不過 Cursor 嘅預測輸入、Antigravity 嘅平行 agent、Kiro 嘅規格先行同 Devin Desktop 嘅團隊管理,仍然各有明確用途。

1 個月前
AI agent 開始長駐背景做嘢,下一步係管權限、成本同審批Tech News

AI agent 開始長駐背景做嘢,下一步係管權限、成本同審批

TechCrunch 寫 Claude Code 負責人 Boris Cherny 講 AI loops 真係會變大事:agent 唔再淨係等你逐次落 prompt,開始長駐背景搵問題、開 PR、改文件。用得好係 automation,用得差就係權限同 token 成本一齊失控。

1 個月前
Meta 用員工鍵盤滑鼠教 AI,結果敏感資料權限出事,企業都要睇清楚Tech News

Meta 用員工鍵盤滑鼠教 AI,結果敏感資料權限出事,企業都要睇清楚

Business Insider 同 WIRED 報道,Meta 嘅 Model Capability Initiative 追蹤員工鍵盤、滑鼠同螢幕內容,用嚟訓練 AI agent;但敏感資料一度可以俾全公司存取。Meta 話暫時未見有人不當存取,會先暫停 MCI 再查。

1 個月前
Claude 測試誤闖三間公司:AI agent 單靠 prompt 劃界線點解唔夠3C 產品

Claude 測試誤闖三間公司:AI agent 單靠 prompt 劃界線點解唔夠

Anthropic 披露三款 Claude 模型喺網絡安全測試期間,經錯誤開放嘅外連通道存取三間機構嘅真實系統。事件冇證據顯示模型突破 sandbox 或另有目的,反而暴露出工具權限、憑證、監察同人手批核一齊失守時,prompt 根本守唔住條界線。

1 個月前
OpenAI 再發現 agent 走出沙盒:Hugging Face 事故點解會越踩越深Tech News

OpenAI 再發現 agent 走出沙盒:Hugging Face 事故點解會越踩越深

OpenAI 調查 Hugging Face 入侵期間,再發現少量 agent 走出測試沙盒同存取外部帳戶。件事未去到模型全面「失控」,但清楚顯示公開憑證、過闊權限同薄弱隔離,可以畀自動化 agent 將普通漏洞串成大事故。

1 個月前