Cloudflare 要 AI 爬蟲分清搜尋同訓練,網站內容有價可講
Tech News

Cloudflare 要 AI 爬蟲分清搜尋同訓練,網站內容有價可講

圖片:via TechCrunch — https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/
TechLab 編輯部(譯)·

9 月 15 日起,新站同未改設定嘅免費客戶會先受影響

先講清楚:唔係全網一刀封

Cloudflare 今次拋出嘅 deadline 係 2026 年 9 月 15 日。到時新加入 Cloudflare 嘅 domain、現有客戶新開嘅 site,同未喺 dashboard 改過設定嘅現有免費客戶,預設會容許 Search crawler 繼續入嚟;至於有廣告嘅頁面,Cloudflare 講法係會預設擋 Training 同 Agent crawler。最麻煩係混合用途 crawler,例如同一隻 bot 又做搜尋索引、又拎內容做 AI 訓練或者即時回答,Cloudflare 話會按最嚴嗰個用途處理。換句話講,網站主唔係即刻同所有 AI 斷絕來往,而係多咗一個預設立場:你想攞內容,就講清楚攞嚟做咩。

Cloudflare AI bot controls 入面 Search、Training 同 Agent 分開設定嘅畫面

圖片:Cloudflare

點解而家先郁手

以前 web crawler 嘅交易好簡單:你爬我個頁,我換返搜尋流量。AI search 同 agent 打散咗呢條數。用家問完就走,網站未必有 click;AI 公司就不停重新抓同一批冇變嘅頁面,Cloudflare 官方話超過 50% AI crawler 流量都花喺重抓未改內容。Pew Research Center 2025 年研究亦見到,有 AI summary 嘅 Google 搜尋頁,傳統結果 click rate 低過冇 summary 嗰啲。出版商唔滿意,唔只係版權問題,而係原本靠搜尋流量換內容曝光嗰套生意模式開始失效。

Cloudflare 官方 blog 用嚟示意 AI search 同內容索引嘅插圖

圖片:Cloudflare

Google 嗰個位最尷尬

Cloudflare 明顯係向混合用途 crawler 開刀,Google 就係爭議中心。Google 官方有 Google-Extended,網站可以用 robots.txt 控制內容可唔可以用喺 Gemini Apps 同 Vertex AI API;Google 文件亦寫明,Google-Extended 唔影響網站入唔入 Google Search,亦唔係 ranking signal。不過 Googlebot 本身負責 Google Search 同 Search features,AI Overviews、AI Mode 呢類功能就坐正喺呢個灰位。網站想要搜尋曝光,但又唔想內容俾 answer engine 食咗,現實上好難切得乾淨。

Cloudflare 想做收費閘口

Pay Per Crawl 去年已經出咗 private beta,做法係用 HTTP 402、簽名 header 同 bot 身份驗證,畀網站按 request 收錢。今次 Cloudflare 再推 Pay Per Use,講法再進一步:唔淨係 crawler 抓一次就收一次,而係當內容真係出現喺 AI search 結果、或者 agent 要讀 premium content 嗰刻先計數。Ceramic.ai 同 You.com 係首批合作例子。呢套玩法未必即刻養得起細網站,不過佢令「內容授權」變成 API 同 policy 問題,開發者做 crawler、RAG pipeline、research agent 時避唔開。

香港網站要睇兩樣嘢

香港有唔少媒體、blog、電商同公司官網都用 Cloudflare,尤其係有廣告位、會員內容、知識庫或者產品資料嗰啲。今次最實際要做嘅,係盤點 dashboard 入面 AI Crawl Control、robots.txt、Content Signals 同 bot allow/block 規則,有冇同自己生意衝突。想畀 Google Search 繼續收錄,未必等於要畀 training bot 任攞;但如果你靠 AI search 帶新客,封得太狠亦可能令自己少咗曝光。所以重點唔係一刀切封晒,而係網站主自己要定清楚邊類 bot 可以入、邊類要擋、邊類要收費。

對 AI 公司同 developer 嘅訊號

OpenAI、Anthropic、Google、Microsoft,甚至細團隊做 coding agent 或 research agent,以後都要正視 bot identity。只靠改 user-agent 或假扮 browser,短期可能攞到頁面,但之後亦可能要面對 CDN、WAF、payment layer 同合約限制。對 developer 嚟講,RAG pipeline 唔可以再假設公開 URL 就等於可任用;你要記錄來源、尊重 robots policy、處理 402/403,仲要諗清楚資料可唔可以寫入 vector DB、cache 幾耐、可唔可以重用喺答案入面。

9 月 15 日前睇咩

呢件事最值得睇嘅位係 Cloudflare 掌握咗 web 邊緣層,有能力令 robots.txt 呢類軟訊號升級成預設阻擋同收費協議。AI 公司可以話開放 web 重要,網站主可以話內容要收錢,分歧會落喺 crawler 分類、身份驗證同預設開關。9 月 15 日前,最值得睇係 Google、Microsoft 呢類混合用途 crawler 會唔會拆清楚用途,Cloudflare 又會唔會收窄適用範圍。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook