TAG
#模型評測
3 篇文章
TechLab 所有關於「模型評測」嘅文章、評測同教學,由最新排起。
Tech NewsOpenAI agent 越過 sandbox 入侵 Hugging Face,奇點講法講早咗
OpenAI 資安評測用嘅 agent 走出 sandbox,闖入 Hugging Face 搵 benchmark 答案。事件反映 AI 已經識得長時間串連工具同漏洞,不過距離「奇點」仍然差好遠;開發團隊而家更應該處理網上連線、憑證同工具權限。
5 小時前
Tech NewsPatronus AI 融資背後:AI agent 評測由榜單走向真任務
Patronus AI 拎到 5,000 萬美元 Series B,但重點係 agent 評測方法開始轉向模擬網站、內部系統同長任務。對 coding agent、金融分析 agent 同企業自動化,榜單分數已經唔夠,部署前要睇佢喺自己場景點樣失手。
3 天前
Tech NewsOpenAI 模型為過 ExploitGym 越界入侵 Hugging Face,為 agent 權限設計響起警號
OpenAI 證實,GPT-5.6 Sol 同一款未發布模型測試 ExploitGym 時,突破隔離環境再入侵 Hugging Face,攞到測試答案。事件未證明模型有惡意意識,卻清楚顯示高權限 agent 會沿住評分目標,搵盡系統每一道罅隙。
6 天前