Cloudflare 出事點解幾個大網站一齊死?今次睇 outage 要睇三層
3C 產品

Cloudflare 出事點解幾個大網站一齊死?今次睇 outage 要睇三層

圖片:via Android Authority — https://www.androidauthority.com/internet-outage-2-3679954/
TechLab 編輯部(譯)·

官方指北美東部第三方網絡供應商光纖斷線,CDN 同 Access 等受拖累

先講清楚發生咩事

香港時間 6月22日夜晚,Android Authority 留意到 Reddit、X 同其他網站有連線問題;Cloudflare 狀態頁亦喺 13:35 UTC 起記錄多個服務 error rate 同 latency 上升。到 14:48 UTC,官方更新話正調查北美東部光纖斷線,經北美連線或者連去歐洲服務嘅客戶,可能見到延遲同 timeout。呢單其後已經解決,所以唔好一口咬定全球每個網站都受影響,但大方向好清楚:出事點唔一定喺你部機。

點解一間公司出事,可以拖幾個網站落水

Cloudflare 唔係淨係做 CDN。好多網站用佢做 DNS、CDN、WAF、DDoS 防護,甚至登入前置層 Access、Workers KV / Durable Objects 呢類 edge 運算服務。Cloudflare CDN 係反向代理:用戶先打到 Cloudflare,再經 Cloudflare 拎快取或者返 origin server。呢層平時加速同擋攻擊好有用,但如果同一段網絡路徑、快取層或者登入保護層出事,表面上就會見到幾個無關網站同一時間慢、500、timeout,甚至登入卡住。

官方當時點講

事發當日 14:49 UTC,Cloudflare 整體頁面顯示 Minor Service Outage,但「Increased Error Rates」呢個 incident 本身影響級別標做 major,受影響項目包括 CDN/Cache、Analytics、Durable Objects、Workers KV,Access 後來亦轉 degraded。另一單 Managed Rules 部署受阻影響 Firewall,係分開 incident。呢啲字眼對普通用戶未必有感,但對網站管理員好關鍵:CDN/Cache 會影響網頁同 API 回應,Access 會影響受保護後台或者內部 app,Workers KV / Durable Objects 會影響用 Cloudflare 寫出嚟嘅功能。

香港用戶要點睇

喺香港,如果你開唔到 X、Reddit 或者某個 SaaS,第一個反應好多時係重開 router,但今次呢類事故要冷靜啲拆。Cloudflare 官方講到嘅風險位主要係經北美連線同連去歐洲服務;香港本身冇官方點名,不過好多海外 SaaS、登入、付款、圖片/CDN、API 都喺北美或者歐洲有依賴,你可能只係開某個頁面唔得,其他網站照上。呢種「半死不活」特別煩,因為佢唔似全屋斷網咁易判斷。

三步分清 Wi-Fi、ISP 定服務商

第一步,先用同一部手機關 Wi-Fi 轉 5G,再開同一個網址。如果 5G 得、屋企 Wi-Fi 唔得,多數係家用連線、DNS 或者 ISP 路由;如果兩邊都唔得,但其他網站正常,問題就多數喺嗰個服務或者背後基建。第二步,換 DNS 只係排查工具,唔係魔法;可以試 1.1.1.1 或者 8.8.8.8,之後再用瀏覽器 private window 開一次,睇係 DNS 快取、cookie/session,定真係 server 回應錯。

第三步,睇錯誤訊息。見到 Cloudflare 標誌嘅 502/503/504、Ray ID、timeout,多數代表你已經打到 Cloudflare edge,但佢同 origin 或者中間服務溝通有問題;DNS_PROBE、NXDOMAIN 就偏向 DNS;連 speedtest 都慢先懷疑 ISP 或者屋企上網。Downdetector 呢類工具有用,但佢係群眾回報,適合睇「有冇一堆人同時叫救命」,最後都要對返官方 status page、服務商社群公告同自己監控數據。

管網站嘅人要多做一層

普通用戶等修復就得,網站管理員要多睇一層:origin server 係咪健康、Cloudflare dashboard 有冇改唔到設定、Analytics 係咪失真、Workers / KV 有冇 error spike。最實際係保留外部 uptime monitor,最好分幾個 region 測 HTTP、DNS 同 TLS,唔好淨係喺同一個雲端區域 ping 自己。Cloudflare 出事時,管理頁面同 API 都可能慢,手上要有 origin 直連、DNS 變更、暫停 proxy、狀態公告呢幾套後備做法,但唔好喺未確認 root cause 前亂改 production。

事後要睇咩

呢單其後已經解決,官方當時講到光纖斷線,同埋工程團隊正減低影響。事後值得留意 Cloudflare 有冇再交代影響範圍、修復時間線、點解 CDN/Cache、Access、KV 呢幾個服務一齊受拖累。對一般人嚟講,今次學識一樣嘢已經夠用:一個 app 開唔到,唔代表你部機壞;幾個無關網站一齊死,就要先查 status page 同 outage tracker,再決定使唔使郁自己上網設定。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook