Claude 五項服務中斷 36 分鐘:Claude Code、API 點樣避開單點故障
Tech News

Claude 五項服務中斷 36 分鐘:Claude Code、API 點樣避開單點故障

圖片:via iThome — https://www.ithome.com.tw/news/178172
TechLab 編輯部(譯)·

事故已經修復,官方暫未交代成因;開發者要補好重試同後備路徑

半個鐘多啲,一次過打中五個入口

香港時間 8 月 17 日朝早 5 時 58 分,Anthropic 開始調查 Claude.ai、Claude Code 同 Claude Cowork 嘅登入問題;去到 6 時 02 分,官方確認 Claude Console 同 API 都出現效能異常。官方喺 6 時 22 分推出修正,觀察多 12 分鐘後,官方喺 6 時 34 分宣佈服務回復正常。即係由第一則事故通知計,成件事維持約 36 分鐘。

iThome 報道將事故形容做大規模中斷,而 Anthropic 狀態系統亦把影響級別標做 critical。不過時間上始終只係半個鐘多少少,叫佢做長時間大當機就有啲過火。今次較值得留意嘅係,Claude.ai、Console、API、Claude Code 同 Cowork 五個入口一齊受影響;無論用網頁傾偈、寫程式,定靠 API 跑自動化工序,都可能同一時間卡住。

Claude 五項服務中斷 36 分鐘:Claude Code、API 點樣避開單點故障

圖片:Wikimedia Commons — Marine BAJAN(CC BY-SA 4.0)

Claude Code 唔等於離線工具

Claude Code 跑喺開發者部電腦入面,好容易令人覺得佢同網頁版係兩套嘢。不過 Anthropic 官方文件講明,Claude Code 預設會連去 Anthropic API,認證同模型運算亦要靠網上服務。今次由登入異常開始,之後連 API 效能都出問題,所以轉去 Claude Code、Console,甚至開另一個 API key,都未必避得到同一場事故。

呢點亦係今次最實際嘅提醒:幾個介面背後都可能依賴同一套服務,所以唔可以當成獨立後備。 不過官方暫時冇公開根本原因,單靠時間線睇唔出係認證系統、模型後端定其他基建出事,亦唔應該自行估。可以確定嘅只有受影響元件同修復時間,至於五項服務點解一齊受牽連,要等 Anthropic 再交代。

撞到錯誤,先睇狀態頁再郁設定

Claude Code 突然登入唔到,或者 API 大量報錯,第一步可以先查官方狀態頁,睇清楚係咪已有事故。若果官方已經確認服務異常,急住登出、重裝工具或者更換 API key,通常幫助有限,仲可能令事後排查複雜咗。開發團隊最好同時記低錯誤時間、HTTP 狀態碼同 request_id,之後要搵支援都容易對得返。

Anthropic 嘅 API 文件建議,遇到 500 類內部錯誤要用指數退避方式重試;官方 SDK 對連線錯誤、限流同 5xx 錯誤,預設會自動重試兩次,有 retry-after header 亦會跟。實際部署仲要加重試上限同隨機延遲,避免大量失敗請求一齊再湧入。401、403 呢類認證或權限錯誤就要分開處理,盲目重試只會製造更多雜訊。

後備方案唔可以只靠同一個供應商

用 API 跑客服、文件整理或者程式任務嘅團隊,可以先把未完成項目放入佇列,保存輸入同進度,等服務回復先續跑;會寫入資料嘅任務亦要有重複執行保護,免得重試後出現兩份結果。再加逾時、熔斷同清楚嘅失敗提示,服務冧嗰陣至少唔會拖住成個系統,亦唔會畀用戶望住畫面無限轉圈。

真係關鍵嘅工序就要預備第二個模型供應商,或者保留人工處理路徑。另一個 Claude 帳戶或 API key 仍然可能撞到同一場服務事故,作用有限。跨模型切換亦唔係改個名稱就完成,prompt、工具格式、輸出結構同安全規則都要預先測試;否則主服務一冧,後備雖然答到嘢,結果就未必可以直接交畀下游系統。

下一步要睇 Anthropic 會唔會交代成因

截至香港時間 8 月 17 日,官方事故頁只確認修正已推出同五項服務已回復,未有公開事後報告。今次中斷唔算耐,但已經夠阻住一輪清晨批次、程式任務同 API 整合。依賴 Claude 處理關鍵工序嘅團隊,可以趁事故記憶仲新,檢查重試、佇列、告警同人工接手路徑;下一步就睇 Anthropic 有冇補充根本原因同預防措施。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook