
Anthropic 高薪請核武生化專家,Claude 安全網點解仲要真人把關
自動分類器負責大規模攔截,專家就處理意圖、灰位同新型攻擊
TechNews 科技新報報道,Anthropic 正招聘一批 Safeguards Enforcement Analyst,範圍包括生化風險、放射性及核風險、爆炸品、網絡犯罪、詐騙同兒童安全。當中兩個武器相關職位嘅美國年薪範圍係 24.5 萬至 28.5 萬美元。個銀碼幾搶眼,不過職位只開放畀美國遙距或指定城市混合辦公,亦冇證據顯示公司正處理一宗已發生嘅核武或生化濫用事件。
呢份工其實似高度專業化 Trust & Safety
睇返 Anthropic 官方職位描述,分析員唔係坐喺度教模型認核武關鍵字。佢哋要睇平台活動同真實模型互動,判斷個案屬正常研究、雙重用途問題,抑或有可信嘅惡意意圖;再整理證據、分流風險、處理緊急升級個案,同工程及數據團隊改善偵測模型。生化職位要求相關學科背景,核風險職位就提到核工程、放射化學、核不擴散制度同物料取得路徑等知識。
呢度解釋到點解 Anthropic 想搵識得用攻擊者角度諗嘢嘅人。普通內容審查可以靠字眼同既定政策,但核安全、生物研究同資安都有大量合理用途。同一條技術問題,研究員可能想評估實驗風險,另一個人就可能逐步收集可執行資料。單睇一個 prompt 好易判錯,互動脈絡、技術可行性同連續行為先幫到手分辨風險。
Claude 嘅安全網有幾層
Anthropic 公開嘅 ASL-3 部署報告顯示,受相關保護措施涵蓋嘅模型會用 Constitutional Classifiers 實時檢查輸入同輸出,命中指定高風險用途就截停。平台亦會用運算量較高嘅離線分類器翻查可疑活動,搵出實時系統漏咗嘅 jailbreak 模式;另外仲有紅隊測試、漏洞獎勵、威脅情報、可信用戶人工審核同快速修補。公司話,已知漏洞通常可以喺一至十日內靠調整分類器處理,牽涉系統根本問題就可能要幾星期至幾個月。
招聘分析員補嘅正正係呢套系統最難自動化嗰截:分類器可以大量掃描,但新型攻擊冇現成標籤,政策亦未必覆蓋每個灰位。真人要判斷行為去到咩程度先要限制帳戶、交畀其他團隊跟進,甚至按既定程序升級。佢哋再將實際個案變成新規則同訓練資料,令下一輪自動偵測準確啲。呢種循環好接近大型平台反詐騙同反濫用團隊,只係判斷所需嘅專業門檻高好多。
攔得緊,正常研究亦可能受影響
安全系統攔得愈緊,代價就係正常內容亦可能俾人誤攔。Anthropic 報告承認,一次快速修補測試將攻擊成功率由 11% 壓到 0.53%,但指定生物學數據集嘅誤攔率亦由 17.9% 升到 21.5%。公司同時強調,呢組數字源自特定測試,唔等同所有 Claude 使用情況。即使呢組數字只反映特定測試,亦解釋到點解研究、教育同資安工作間中會撞到攔截。:分類器要趕住堵漏洞,正常但專門嘅內容亦可能一併中招。
所以,呢輪招聘較合理嘅解讀係 Anthropic 正將安全措施擴展成一套長期營運系統。職位頁證明公司肯投放資源,冇證明 Claude 已經可以協助非專家製造大殺傷力武器。下一步要睇嘅係專家判斷能否減少誤判、申訴同可信研究者嘅審批機制夠唔夠清楚,同埋 Anthropic 會唔會公開更多實際執行成效。
參考來源
- TechNews 科技新報 — Anthropic 招募「核武與生化武器」執法分析師,高薪求「攻擊者思維」專才 — original report
- Safeguards Enforcement Analyst, Bio Harms — Anthropic 官方職位頁,列出生化風險分析員職責、資格、薪酬同工作地點。
- Safeguards Enforcement Analyst, Radiological & Nuclear Harms — Anthropic 官方職位頁,列出放射性及核風險分析員嘅審查、分流同系統改善工作。
- Activating AI Safety Level 3 protections — Anthropic 官方解釋 ASL-3 措施針對 CBRN 武器濫用,同一般拒答範圍嘅分別。
- ASL-3 Deployment Safeguards Report — 官方技術報告,交代實時及離線分類器、紅隊、快速修補、可信用戶審批同誤判取捨。
- Help wanted: Anthropic hires to head off catastrophe — 原始英文報道來源,確認招聘範圍同高薪職位背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







