ShieldFont 用字體餵錯料畀 AI scraper,網站開發者要先計清五筆代價
Tech News

ShieldFont 用字體餵錯料畀 AI scraper,網站開發者要先計清五筆代價

圖片:via Ars Technica — https://arstechnica.com/ai/2026/08/new-font-turns-ordinary-webpages-into-nonsense-for-ai-scrapers/
TechLab 編輯部(譯)·

Ligature 可拖慢平價抓取,不過 SEO、無障礙同中文支援都有硬傷

畫面係原文,HTML 就係另一回事

ShieldFont 呢招幾古惑:網站交畀瀏覽器嘅 HTML,擺住嘅其實係換過字嘅句子;專用字體再用 OpenType GSUB ligature,將整個誘餌字串畫成原本想顯示嘅英文字。人眼睇落篇文完全正常,只下載 HTML、抽 textContent 或解析 DOM 嘅平價 scraper,就會拎到文法通順但意思錯晒嘅版本。傳統 ligature 多數將「fi」合成一個順眼 glyph,ShieldFont 就將同一套字形替換機制推到成個英文字咁長。

目的係整污糟資料,效果仍然屬早期

官方聲稱,字典以一萬個常用英文字做基礎,集中換走名詞、動詞、形容詞同副詞。佢哋用新聞、獨立網站同小說合共 1,500 段文字測試,換走約四分一字詞後,有一半段落已經講唔返原本嘅事實;經 FineWeb-Edu 品質篩選時,大約九成原本合格嘅內容會俾篩走,餘下一成就帶住錯誤意思入資料集。呢啲數字全部來自 ShieldFont 團隊嘅白皮書,暫時冇大規模獨立驗證,連團隊都承認細模型測試未足以證明會拖低大型模型。

OCR 同拆字體,都行得通

有心針對某個網站嘅 scraper,可以載入頁面、截圖再跑 OCR,直接讀返人眼見到嘅字。另一條路仲直接:下載字體檔,抽出 GSUB 替換表,再反向解碼 HTML。ShieldFont 團隊話,佢哋自己已完整還原公開字體入面 11,962 組配對,而且零錯誤。網站可以另造私人字典,令通用 decoder 失效,不過映射仍然藏喺訪客要下載嘅字體檔。保護力主要來自迫對方逐站分析、渲染或跑 OCR,令大量抓取貴咗同慢咗。

SEO 代價可能重過擋 crawler 嘅收益

搜尋引擎索引嘅同樣係 HTML 字詞,所以官方 GitHub 明確警告,想靠 Google 帶流量嘅內容唔好包入 ShieldFont。Googlebot 本身會執行 JavaScript 同渲染網頁,但索引仍以可讀取嘅文件內容為基礎,唔會單靠字形外觀估返原句。另一個漏洞係 RSS、OpenGraph、JSON-LD、CMS API 同電郵 newsletter:呢啲出口通常直接用資料庫原文生成,未一併編碼就等於留咗幾道純文字側門,crawler 連字體都唔使處理。

複製文字同 screen reader 要靠補丁

基本模式下,複製貼上、頁內搜尋、翻譯同 Reader Mode 拎到嘅都可能係誘餌字。ShieldFont 有個 beta 純文字模式:先用 aria-hidden 收起錯字,再由瀏覽器跑 JavaScript 解開原文,畀 screen reader 同剪貼簿使用。不過官方亦講明,使用者要等幾秒,而且即使全開無障礙功能,受保護區塊仍過唔到 WCAG 2.2 SC 1.3.1;強制改用自訂字體時,畫面更可能直接顯示錯誤英文。對新聞、教育、政府或企業網站嚟講,呢筆代價唔細。

粵語網站而家用唔着核心功能

現版本只處理英文,中文同其他語言會原樣放行。英文、中文混合嘅頁面亦只保護到部分內容,所以粵語內容站即使裝好套件,正文大多數仍可照抓。再計埋 SEO、metadata、無障礙同前端相容性,ShieldFont 暫時較適合唔依賴搜尋流量、以長篇英文為主,而且願意自行整私人映射嘅小眾出版項目;一般媒體全站套用,風險高過實際收益。

放喺現有防線後面先合理

robots.txt 只係向 crawler 表達規則,對方肯唔肯跟仍由佢決定;Cloudflare 呢類服務就可以按 Search、Agent、Training 行為分類,再用 WAF 阻擋已識別嘅 bot。ShieldFont 主要對付漏網 crawler,等入到頁面嘅廉價 scraper 只拎到較差嘅資料。開發者現階段可以喺非關鍵英文頁面做隔離測試,同時檢查 Search Console、screen reader、剪貼簿、RSS 同 structured data;等有獨立研究同非英文支援,再考慮擴大使用範圍。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook