
ShieldFont 用字體餵錯料畀 AI scraper,網站開發者要先計清五筆代價
Ligature 可拖慢平價抓取,不過 SEO、無障礙同中文支援都有硬傷
畫面係原文,HTML 就係另一回事
ShieldFont 呢招幾古惑:網站交畀瀏覽器嘅 HTML,擺住嘅其實係換過字嘅句子;專用字體再用 OpenType GSUB ligature,將整個誘餌字串畫成原本想顯示嘅英文字。人眼睇落篇文完全正常,只下載 HTML、抽 textContent 或解析 DOM 嘅平價 scraper,就會拎到文法通順但意思錯晒嘅版本。傳統 ligature 多數將「fi」合成一個順眼 glyph,ShieldFont 就將同一套字形替換機制推到成個英文字咁長。
目的係整污糟資料,效果仍然屬早期
官方聲稱,字典以一萬個常用英文字做基礎,集中換走名詞、動詞、形容詞同副詞。佢哋用新聞、獨立網站同小說合共 1,500 段文字測試,換走約四分一字詞後,有一半段落已經講唔返原本嘅事實;經 FineWeb-Edu 品質篩選時,大約九成原本合格嘅內容會俾篩走,餘下一成就帶住錯誤意思入資料集。呢啲數字全部來自 ShieldFont 團隊嘅白皮書,暫時冇大規模獨立驗證,連團隊都承認細模型測試未足以證明會拖低大型模型。
OCR 同拆字體,都行得通
有心針對某個網站嘅 scraper,可以載入頁面、截圖再跑 OCR,直接讀返人眼見到嘅字。另一條路仲直接:下載字體檔,抽出 GSUB 替換表,再反向解碼 HTML。ShieldFont 團隊話,佢哋自己已完整還原公開字體入面 11,962 組配對,而且零錯誤。網站可以另造私人字典,令通用 decoder 失效,不過映射仍然藏喺訪客要下載嘅字體檔。保護力主要來自迫對方逐站分析、渲染或跑 OCR,令大量抓取貴咗同慢咗。
SEO 代價可能重過擋 crawler 嘅收益
搜尋引擎索引嘅同樣係 HTML 字詞,所以官方 GitHub 明確警告,想靠 Google 帶流量嘅內容唔好包入 ShieldFont。Googlebot 本身會執行 JavaScript 同渲染網頁,但索引仍以可讀取嘅文件內容為基礎,唔會單靠字形外觀估返原句。另一個漏洞係 RSS、OpenGraph、JSON-LD、CMS API 同電郵 newsletter:呢啲出口通常直接用資料庫原文生成,未一併編碼就等於留咗幾道純文字側門,crawler 連字體都唔使處理。
複製文字同 screen reader 要靠補丁
基本模式下,複製貼上、頁內搜尋、翻譯同 Reader Mode 拎到嘅都可能係誘餌字。ShieldFont 有個 beta 純文字模式:先用 aria-hidden 收起錯字,再由瀏覽器跑 JavaScript 解開原文,畀 screen reader 同剪貼簿使用。不過官方亦講明,使用者要等幾秒,而且即使全開無障礙功能,受保護區塊仍過唔到 WCAG 2.2 SC 1.3.1;強制改用自訂字體時,畫面更可能直接顯示錯誤英文。對新聞、教育、政府或企業網站嚟講,呢筆代價唔細。
粵語網站而家用唔着核心功能
現版本只處理英文,中文同其他語言會原樣放行。英文、中文混合嘅頁面亦只保護到部分內容,所以粵語內容站即使裝好套件,正文大多數仍可照抓。再計埋 SEO、metadata、無障礙同前端相容性,ShieldFont 暫時較適合唔依賴搜尋流量、以長篇英文為主,而且願意自行整私人映射嘅小眾出版項目;一般媒體全站套用,風險高過實際收益。
放喺現有防線後面先合理
robots.txt 只係向 crawler 表達規則,對方肯唔肯跟仍由佢決定;Cloudflare 呢類服務就可以按 Search、Agent、Training 行為分類,再用 WAF 阻擋已識別嘅 bot。ShieldFont 主要對付漏網 crawler,等入到頁面嘅廉價 scraper 只拎到較差嘅資料。開發者現階段可以喺非關鍵英文頁面做隔離測試,同時檢查 Search Console、screen reader、剪貼簿、RSS 同 structured data;等有獨立研究同非英文支援,再考慮擴大使用範圍。
參考來源
- Ars Technica — The web’s newest weapon against AI scrapers is a font — original report
- ShieldFont 官方網站 — 官方示範、安裝方法、測試數字、OCR 限制同無障礙模式說明。
- The Consent Layer — ShieldFont White Paper — 研究方法、品質篩選結果、字詞替換策略同早期模型測試限制。
- ShieldFont GitHub — 原始碼、框架整合方法,以及 SEO、WCAG、中文支援、複製貼上同 feeds 漏洞等已知限制。
- Google Search:JavaScript SEO 基礎 — 核對 Googlebot 點樣抓取、渲染同索引 JavaScript 網頁。
- Google Search:robots.txt 使用限制 — 說明 robots.txt 依賴 crawler 自願遵守,唔屬於存取控制。
- Cloudflare:Block AI Bots — 比較可按 Search、Agent 同 Training 行為執行嘅網絡層阻擋方案。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







