Perplexity 買 Google 搜尋結果畀 AI 用,點解 Reddit 可以靠 DMCA 追落去?
Tech News

Perplexity 買 Google 搜尋結果畀 AI 用,點解 Reddit 可以靠 DMCA 追落去?

圖片:via Ars Technica — https://arstechnica.com/tech-policy/2026/07/reddit-keeps-weird-dmca-lawsuit-against-web-scraper-alive-despite-googles-loss/
TechLab 編輯部(譯)·

兩宗 SerpApi 裁決,拆出反爬蟲、版權同第三方 API 嘅灰位

美國法院暫時畀 Reddit 繼續追究 SerpApi 同 Perplexity,指控兩間公司合作繞過 Google 反爬蟲系統,攞走搜尋結果入面嘅 Reddit 內容。呢次只係法官大致拒絕撤銷案件,即係現階段先當 Reddit 嘅指控屬實,相關做法的確有可能違法;指控未經審訊證實,亦唔代表 Reddit 已經贏咗。不過對整 AI 搜尋、RAG 或資料分析工具嘅團隊嚟講,呢宗案已經點出一個幾實際嘅風險:向第三方買結果,唔會自動洗走資料來源問題。

一個 API call 背後,其實過咗幾道門

成條資料鏈可以咁睇:用戶問 Perplexity 問題,Perplexity 要搵即時網上資料;SerpApi 就代客向 Google 搜尋,自動處理 JavaScript、CAPTCHA、bot 偵測、IP 限制等障礙,再將搜尋頁變成容易俾程式食嘅結構化資料。Google 結果入面可能有 Reddit 連結、帖文摘要、圖片或其他片段,Perplexity 拎到之後再組成答案。開發者眼中只係一個乾淨 JSON response,法院睇嘅就包括每層由邊個提供、點樣攞到,同期間有冇刻意避過存取限制。

Reddit 話自己已封鎖未獲准嘅直接抓取,而 SerpApi 等供應商就改為由 Google 搜尋結果攞 Reddit 資料。訴狀仲指供應商會輪換 IP、扮普通瀏覽器流量同處理 CAPTCHA。Reddit 曾放出一段只預期經 Google 搜尋搵到嘅測試內容,幾個鐘後 Perplexity 答案就出現相關文字。呢個「蜜罐」測試顯示,資料可能係繞路攞返嚟,但未單獨證明每次請求都由 SerpApi 提供,更未證明雙方已犯法

DMCA 點解會管到網頁抓取?

今次用到嘅 DMCA 第 1201 條,本來主要針對繞過控制版權作品存取嘅技術措施,例如破解加密或避過數碼鎖。Reddit 嘅講法係,Google 嘅 SearchGuard 屬有效存取控制;SerpApi 提供工具避過佢,Perplexity 又付費使用相關服務,所以兩邊可能分別涉及繞過措施、提供繞過工具同串謀。爭議位好清楚:Google 搜尋頁任何人用瀏覽器都睇到,SearchGuard 擋嘅主要係自動程式,咁仲算唔算保護緊一件受版權保障嘅作品?

公開頁面亦唔等於所有取用方法都冇限制。瀏覽器睇到,只能說明內容對一般訪客公開;自動扮真人過 CAPTCHA、輪換 IP,再大量轉售結果,仲牽涉網站條款、server 存取、版權授權同反規避規則。另一邊亦有合理憂慮:如果平台只要加一道 bot challenge,就可以借 DMCA 封死公開資料,研究、新聞、搜尋監察同網頁存檔都可能一併受影響。法院要畫嘅線,正正夾喺呢兩種風險中間。

Google 輸咗,Reddit 點解仲追得落去?

Google 另一宗針對 SerpApi 嘅案件,法院將搜尋結果拆開處理。普通連結、事實資料同冇受版權保障內容嘅結果,唔符合 DMCA 要求,相關部分唔准再改。至於 Knowledge Panel 入面可能獲授權使用嘅圖片或內容,Google 又未提出足夠事實,證明版權持有人授權佢用 SearchGuard 保護嗰啲作品,所以法院只准 Google 修改訴狀再試。嗰份裁決亦冇全面宣布抓取搜尋結果合法,亦接受 SerpApi 可能曾避過 SearchGuard 嘅推論。

Reddit 呢宗案寫法窄啲,焦點放喺搜尋結果入面嘅 Reddit 內容,以及 Reddit 點樣獲用戶授權、再授權 Google 使用。紐約法官認為,喺案件初段先假設 Reddit 指控屬實,佢已提出足夠理據主張 Google 獲授權用 SearchGuard 控制相關內容嘅存取。結果係針對 SerpApi 同 Perplexity 嘅 DMCA 繞過指控、針對 SerpApi 嘅繞過工具指控,同紐約州民事串謀指控暫時保留;另一項 DMCA 權利控制指控、不當得利同不公平競爭則遭撤銷。

買資料服務,來源責任唔可以外判晒

呢宗案對開發者最有用嘅提醒,係供應商風險會沿住 API 入到自己產品。採用 SerpApi、代理網絡或其他 scraping API 前,除咗睇價錢、延遲同成功率,仲要問清楚數據實際來自邊個頁面、會唔會避 CAPTCHA 或存取限制、供應商有冇授權,同埋合約有冇侵權保證、賠償條款同刪除機制。系統亦應保留來源、抓取時間同供應商紀錄,避免日後連一段答案由邊條資料鏈產生都講唔清。

香港冇直接套用美國 DMCA,但本地團隊只要用美國服務、服務海外客戶,或者同受美國條款約束嘅供應商合作,風險依然可能經合約、停用 API、禁制令或索償傳返嚟。內容網站亦唔應只靠 robots.txt 當完整保護;存取控制、服務條款、授權安排同流量監察要互相配合。案件下一步要睇證據披露能否證明 Perplexity 實際買過咩資料、SearchGuard 獲得咩授權,同各方有冇刻意協調繞過防護。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook