
週二,Cloudflare網路發生大規模故障,導致全球網路中斷,數百萬用戶無法存取包括X和ChatGPT在內的熱門服務。這起事件發生在西班牙半島時間中午前後,凸顯了支撐網路的基礎設施的相互關聯性。
這家美國公司是CDN和網路安全領域的重要參與者,該公司證實,其控制面板和API出現了500多起錯誤和故障,目前正在調查這些故障,並著手分階段恢復。西班牙和歐洲其他地區也出現了類似報告,影響範圍涵蓋社交媒體、數位娛樂以及金融服務等各個領域,但程度較輕。
發病時間順序
第一批警報大約在12:30(半島時間)發出,問題高峰出現在 13:00 左右。 Cloudflare 在12:48左右,也就是 1:00 前不久確認了情況,並開始採取緩解措施;到13:15,許多服務開始恢復,儘管在某些環境中仍然存在殘餘故障。
據公司內部人士透露,上午11:20左右,其一項服務出現異常流量高峰,引發網路多個元件出現嚴重故障。儘管大部分流量仍能繼續傳輸,但網路效能下降導致常用應用程式出現明顯中斷。
受影響最大的服務
這次攻擊影響範圍廣泛,波及多個類別的主流平台,尤其是X(前身為 Twitter)和ChatGPT。內容創作和儲存工具、網路遊戲以及一些高流量企業網站也報告了類似事件,產生了顯著的骨牌效應。
- 社群網路與交流: X, 給我點菜 以及監控門戶 Downdetector 它們出現錯誤或載入速度緩慢。
- 人工智慧與生產力: ChatGPT, Canva, Dropbox的 部分商業服務出現間歇性中斷。
- 金融及服務業:據報道有問題 Coinbase 以及企業網站,例如 穆迪使用者提到了一些具體困難,例如某些實體。 凱克薩銀行.
- 休閒與電子遊戲: 英雄聯盟 以及娛樂應用,例如 Grindr 他們遭遇了中斷。
- 交通運輸和電信:事故 新澤西州交通 以及運營商的臨時中斷或性能下降,例如 Movistar公司.
除了對客戶造成影響外,Cloudflare 的內部服務也在此次事件中受到影響。作為緩解措施的一部分,該公司製定了具體措施,例如暫時關閉倫敦的 WARP 服務以穩定網絡,並在錯誤率恢復正常後重新啟用該服務。
出了什麼問題?已知情況如何?
該公司在最初的聲明中將此次事件定性為內部服務效能下降,並保證正在採取措施加快恢復速度。目前,沒有證據顯示存在外部攻擊;初步判斷是其自身基礎設施存在問題,目前仍在分析中。
事件高峰期,使用者遭遇了大範圍的 500 錯誤和內容載入失敗, Cloudflare控制面板和API也出現問題。該公司表示,將在其狀態頁面 ( cloudflarestatus.com ) 發布更新信息,並在其博客 ( blog.cloudflare.com )上發布深入分析。
對西班牙和歐洲的影響
西班牙的大部分警報集中在午後早些時候,正值工作日高峰期,也是桌上型電腦使用高峰期。個人用戶和企業都受到了影響,社交媒體、人工智慧平台以及銀行和電信服務都出現了間歇性中斷。
對於依賴Cloudflare 作為 CDN 和安全層的歐洲組織而言,這起事件導致延遲飆升、部分中斷和路由錯誤,IT 團隊在公司全球網路復原的同時,實施了應急措施。
重置和後續步驟
Cloudflare報告稱,變更實施後錯誤率有所下降,網路復原工作正在逐步推進。當務之急是確保流量穩定,隨後將進行全面的根本原因分析,以防止類似事件再次發生。
這次事件再次引發了關於過度依賴大型基礎設施提供者的爭論。此前不久,AWS和Azure也相繼發生服務中斷,這次事件凸顯了當數百萬項服務依賴相同的關鍵層時,局部故障會造成多麼廣泛的影響。
這次故障清晰地顯示:一個環節的薄弱可能同時對多個領域產生影響。目前大多數平台已恢復運行,各方關注的焦點集中在技術報告上,該報告詳細闡述了故障原因、緩解措施以及將實施哪些改進措施以增強數位生態系統的韌性。
