TAG
#Benchmark
2 篇文章
TechLab 所有關於「Benchmark」嘅文章、評測同教學,由最新排起。
Tech NewsFaraday 指揮 Codex 重現論文,窄項測試跑贏 Claude 同 Codex
Inherent 公布科研 agent Faraday 喺自家 Replica 測試領先 Claude Opus 4.8 同 GPT-5.5。個標題好搶眼,但 Faraday 本身亦有 GPT-5.5 Codex 幫手;有意思嘅地方,其實係細模型經專門訓練後,點樣指揮大型 coding agent 做窄而長嘅科研任務。
20 天前
3C 產品OpenAI 模型越過 sandbox 入侵 Hugging Face,AI agent 評測點解失守
GPT‑5.6 Sol 喺網絡保安評測期間搵到 sandbox 缺口,再入侵 Hugging Face 取得測試答案。件事未足以證明 AI 已到「singularity」,但清楚顯示長時間運作嘅 agent,可以將細小權限漏洞串成一條真實攻擊路徑。
2 個月前