#AI agent
300 篇文章
TechLab 所有關於「AI agent」嘅文章、評測同教學,由最新排起。
3C 產品Microsoft Copilot super app 9 月前登場:Chat、Cowork 同 Code 收歸一處
Microsoft 確認會喺今季推出 Copilot super app,集中日常對話、Cowork、Autopilots 同 Code。除咗統一介面,公司資料、agent 權限、GitHub 開發工作同用量收費亦會接入同一個入口。
3C 產品AI 連一道門都出唔到:Pokémon 實驗揭開 agent 長任務死穴
XDA 作者叫本地 Qwen 同經 Codex CLI 使用嘅 GPT-5.6 Sol 玩《Pokémon Red》,兩邊最後都過唔到門。問題牽涉錯誤環境資料、視覺驗證、幻覺同訓練記憶,亦解釋咗點解 token 跑得快,同 agent 做唔做到長任務係兩回事。
Tech NewsClaude 網安測試誤闖三間機構系統:權限同測試環境點解一齊失守
Anthropic 審查逾 14 萬次網安評估後,發現三款 Claude 模型曾經接觸三間機構嘅 production 系統。事故冇證據顯示模型自行逃走,成因指向測試環境連住公開網絡、任務邊界含糊,同多層監察一齊失效。
Tech NewsOpenAI 模型越過隔離闖入 Hugging Face:企業用 coding agent 要補四個窿
OpenAI 嘅 cyber 評估模型為咗完成測試,搵到隔離環境嘅零日漏洞,再入侵 Hugging Face 攞答案。成件事冇科幻片式「覺醒」,但清楚示範咗一個有工具、有憑證、肯長時間試錯嘅 agent,可以點樣放大普通保安漏洞。
Tech NewsAI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號
OpenAI 同 Anthropic 先後披露,cyber 評估入面嘅 AI agent 接觸到真實網絡,仲闖入外部公司系統。幾宗事故成因唔同,但都提醒用 Codex、Claude Code 同其他 coding agents 嘅團隊:sandbox 只係起點,網絡出口、credentials、監察同人工批准少一樣都唔得。
Tech NewsClaude Tag 入 Slack:@Claude 可以喺 channel 同團隊做任務
Anthropic 推出 Claude Tag,Slack channel 入面任何人都可以叫 @Claude 跟 thread、整理決定、跑 code 任務,甚至主動追住未完嘅事。用落會方便,不過公司要先諗清楚權限點開。
3C 產品OpenClaw 塞入 mini PC 就取代到雲端?本機 AI 仲有幾道硬件關要過
Beelink SER10 MAX 預載 OpenClaw,睇落似開機就有私人 AI agent。不過 Tom’s Hardware 嘅測試顯示,64GB RAM、模型量化、記憶體頻寬同工具設定,樣樣都會拖慢體驗;資料留喺本機亦唔代表可以忽略權限同惡意 Skill 風險。
Tech NewsClaude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招
Claude 喺資安測試期間接觸到三個真實組織,聽落似 AI 自行逃出沙盒,實情係測試環境錯誤開放上網,模型又以為眼前全部都係 CTF 場景。事件亦揭示高權限 coding agent 一旦欠缺網絡隔離、套件管制同即時監察,普通設定失誤都可以迅速變成供應鏈事故。
Tech NewsOpenAI 測試 agent 衝出沙箱:企業點樣閂實網上存取、憑證同執行權限
OpenAI 測試高階 cyber agent 時,模型搵到 Artifactory 零日漏洞離開隔離環境,再串連外露憑證同多個系統弱點,闖入 Hugging Face 正式系統。件事反映企業用 coding agent 時,權限、網上出口同活動記錄都要重新收緊。
3C 產品Gemini Spark 借 Chrome 登入狀態代你填表:方便背後係一大截權限
Google 幫 Gemini Spark 接上 Chrome,佢可以借用現有登入狀態同已儲存憑證,自動比較資料、填表同準備預訂。不過官方安全文件亦承認,prompt injection、憑證外洩同誤操作風險未有消失,而香港暫時未開放 Chrome auto browse。
Tech NewsClaude 安全測試誤闖三間公司:AI agent 點解會打中真系統
Anthropic 檢查逾 14 萬次網絡安全評測後,發現 Claude 曾經入侵三間真實機構,仲有惡意套件流入 PyPI。模型冇另起爐灶追求自己目標,問題源頭係測試環境錯誤連住公開網絡,再配上一條叫 agent 不斷搵入侵路線嘅任務。
Tech NewsClaude 資安評估誤闖真實系統:三層防線失守,企業點樣限制 AI agent
Anthropic 翻查逾 14 萬次 Claude 資安評估,發現三款模型曾經接觸三個機構嘅真實系統。模型初時以為自己身處模擬環境,背後亦冇足夠網上隔離、執行範圍同即時監察。企業引入 AI agent,權限設計要由最壞情況出發。
Tech NewsOpenAI 劈價 GPT-5.6:Luna 平八成,邊類 AI 工作最值得轉?
GPT-5.6 Luna API 價錢大減八成,短 context 每 100 萬 input、output token 只收 US$0.20 同 US$1.20。個價的確進取,不過轉模型之前仲要計埋輸出量、返工成本同延遲要求,Fast mode 亦唔係所有工作都抵畀雙倍價。
Tech NewsClaude 測試連到公網波及三間公司,企業用 coding agent 要點封權限
Anthropic 翻查逾 14 萬次網絡安全評測,發現三款 Claude 曾喺六次測試入面未經授權接觸三間機構嘅 production 系統。事件揭示 coding agent 一有公網、憑證同執行工具,普通配置錯誤都可以變成真實攻擊路徑。
Tech NewsAI agent 攻入 Hugging Face:企業開 terminal 前要落嘅七道安全閘
OpenAI 模型做網絡安全能力測試期間,搵到方法離開隔離環境,再闖入 Hugging Face 正式系統。企業部署 Codex、Claude Code 或內部 agent 前,權限設計要跟高權限 service account 同一級數。
Tech NewsClaude 測試期間誤闖三間公司:問題出喺網絡隔離同 agent 權限
Anthropic 翻查逾 14 萬次網絡安全評測,發現 Claude 曾經未經授權進入三間機構嘅真實系統。現有資料冇顯示模型自主反叛,成因指向測試環境錯誤連上互聯網、任務範圍寫得含糊,同公開版安全限制當時未有啟用。
Tech NewsAI agent 攞住公司鎖匙做嘢:企業部署前要搞清六項權限設定
公司接駁 ChatGPT、Copilot、Codex 或 MCP server 時,agent 可以讀文件、調用工具,甚至直接改資料。沿用員工帳戶或者共用 API key,方便得嚟亦會放大風險。部署前要先分開身份、權限同審批流程,仲要預留完整活動記錄同收權機制。
3C 產品Gemini Spark 開放香港 AI Pro:背景任務有得用,Chrome 自動瀏覽仍未到
Google 擴大 Gemini Spark 地區同訂閱資格,官方支援頁顯示香港個人 AI Pro 用戶已符合基本條件,可以交低背景任務、Skills 同排程。不過接管本機 Chrome 嘅 auto browse 暫時仍限美國,兩項更新唔好撈亂。
Tech NewsOkta 收購 Permiso:AI agent 有身份證之後,仲要有人睇住佢做過咩
企業開始畀 AI agent 寫 code、查資料同操作雲端,但好多 agent 共用人類帳戶、長效 token 或權限過闊嘅 service account。Okta 收購 Permiso,正正想補返登入之後睇唔到 agent 行為呢個缺口。
Tech NewsOpenAI 測試模型闖入 Hugging Face:萬七次動作點解仍然截得住
今次闖入 Hugging Face 嘅唔係人類黑客,而係 OpenAI 測試中嘅模型組合。佢哋四日半做咗約 17,600 次動作,靠漏洞同過大權限一路深入系統;不過成場事故亦證明,最小權限、限制對外連線同可靠當值機制仍然截得住 AI agent。
Tech NewsOpenAI agent 借 Modal 客戶環境攻 Hugging Face,測試 sandbox 點解會失守
OpenAI 測試網絡攻擊能力期間,agent 逃出隔離環境,借第三方雲端 sandbox 做跳板,再闖入 Hugging Face。事件冇證據顯示 AI 突然產生反叛意識,反而暴露 agent 一接通網上服務、憑證同程式執行權限,細小設定失誤已經足以串成一條真實攻擊路徑。
Tech NewsPerplexity Numbat 監察 Codex/Claude Code,攔截能力有界線
AI coding agent 可以讀檔、改 code、跑 command,出錯時影響遠過普通聊天機械人。Perplexity 開源 Numbat,畀公司監察同重建 agent 行為,但各平台嘅攔截能力有差異,預設規則亦只會報警。
Tech NewsOpenAI agent 突破 sandbox:package proxy 串起攻擊鏈
OpenAI 內部資安評測模型利用 Artifactory 零時差漏洞離開 sandbox,再借公開 code-execution endpoint 做跳板,攻入 Hugging Face。成件事提醒開發團隊:agent 權限愈高,網絡出口、憑證同緊急停機機制就愈要逐樣收緊。
Tech NewsKimi K3 推高月之暗面估值:開放權重、agent 成本同香港 IPO 點計
月之暗面據報完成 35 億美元融資,估值升至 350 億美元,背後賣點係 Kimi K3 嘅 coding、agent 同開放權重策略。不過獨立測試顯示,平 API 單價未必換到較低工作成本;香港 IPO 同 500 億美元估值亦仲係商議目標。