News (KR)

Cloudflare는 Zoom 및 Shopify와 같은 사이트에 영향을 미치는 대시보드 및 API의 새로운 글로벌 중단에 직면했습니다.

Cloudflare
Cloudflare - Mamun_Sheikh/ Shutterstock.com

인터넷 인프라 제공업체인 Cloudflare는 2025년 12월 5일 금요일에 제어판과 API의 전 세계적인 중단을 기록했습니다. 이 문제는 UTC 오전 8시(브라질 시간 기준 오전 5시)쯤에 시작되었으며 대시보드 및 소프트웨어 통합의 사용자 요청에 영향을 미쳤습니다. Zoom 및 Shopify와 같은 종속 플랫폼은 중단이 최고조에 달하는 동안 액세스 오류를 보고했습니다.

모니터링 보고서에 따르면 내부 성능 저하가 회사에서 관리하는 글로벌 웹 트래픽의 약 20%에 영향을 미친 것으로 나타났습니다. 11월 18일에 발생한 유사한 사건에 이어 3주도 안 되어 두 번째 사건이 발생하여 여러 서비스에 걸쳐 오류 500 메시지가 생성되었습니다. 전문가들은 이 사건이 데이터 센터의 예정된 유지 관리 충돌로 인해 발생한 것으로 보고 있습니다.

이번 사고는 유럽, 아시아 등 지역의 피크 시간대에 발생했는데, 오전 교통 정체와 동시에 장애가 발생했다. 비즈니스 사용자는 관리 도구 사용에 어려움을 겪는 반면, 일반 소비자는 전자상거래 및 협업 사이트의 속도가 느려지는 것을 느꼈습니다.

  • 영향을 받는 주요 서비스에는 화상 통화용 Zoom이 포함됩니다.
  • Shopify, 온라인 결제 실패
  • Notion 및 Medium, 페이지 로딩 오류를 표시합니다.

기술적 결함의 세부사항

Cloudflare 엔지니어들은 이 문제를 시카고와 디트로이트의 데이터 센터에서 오전 8시 56분(UTC)에 시작된 내부 서비스 저하로 식별했습니다. 오전 7시에서 오전 11시(UTC) 사이에 이러한 위치에서 예정된 유지 관리가 작업 자동화 도구인 Workers 스크립트의 결함과 충돌했습니다. 회사는 UTC 오전 9시 12분에 부분 수정 사항을 배포하여 한 시간 내에 작업의 70%를 복원했습니다.

DownDetector 자체와 같은 모니터링 플랫폼은 Cloudflare에 대한 의존성으로 인해 일시적으로 액세스할 수 없었습니다. 서버 장애를 알리는 오류 500은 전 세계 개발자가 사용하는 API 통합으로 확산되었습니다. 오전 10시(UTC 기준) 북미 사용자 보고에 따르면 80%의 사례에서 회복된 것으로 나타났으나 아시아 지역에서는 여전히 지연이 발생하고 있습니다.

이 결함은 엣지 레이어의 중단이 수백만 개의 도메인에 동시에 영향을 미치는 웹 서비스의 상호 연결을 강조했습니다. Cloudflare는 DDoS 보호 및 콘텐츠 가속을 포함하여 글로벌 웹사이트의 20%에 대한 트래픽을 관리합니다.

Cloudflare one
Cloudflare.. – 재생산

심층적으로 영향을 받는 서비스

Zoom은 로그인 및 활성 세션의 중단을 확인했으며 유럽 사용자는 오전 9시(CET)에 중단을 보고했습니다. 미디어 배포를 위해 Cloudflare API를 사용하는 플랫폼에서는 사건이 발생한 동안 화상 통화 오류가 40% 급증했습니다.

전자상거래에 초점을 맞춘 Shopify는 결제 페이지가 차단되어 미국의 피크 시간대 거래에 잠재적으로 영향을 미칠 수 있습니다. 내부 보고서에 따르면 온라인 상점의 15%가 45분 동안 주문 처리를 중단했습니다.

디자인 및 생산성 도구인 Canva와 Notion은 업로드 및 공동 편집 시 오류 메시지를 표시했습니다. Notion의 경우 데이터베이스 통합이 실패하여 아시아와 오세아니아의 원격 팀에 영향을 미쳤습니다.

출판 플랫폼인 Medium은 기사 로드 속도가 느리고 인도 사용자들이 IST 오후 2시 30분에 완전히 사용할 수 없다고 보고했습니다.

최근 중단 기록

Cloudflare는 2025년 11월 18일에도 봇 관리 파일의 버그로 인해 4시간의 가동 중지 시간이 발생하면서 비슷한 가동 중단을 겪었습니다. 이 사건에서 X 및 ChatGPT와 같은 서비스는 90분 동안 오프라인 상태가 되어 천만 건의 글로벌 히트에 영향을 미쳤습니다.

2025년 9월 또 다른 기술적 오류로 인해 트래픽이 5%로 느려졌으며 이는 엣지 서버의 과부하와 연결되었습니다. 이러한 사고는 트래픽 수요가 증가하는 1년 동안 누적되며, 2024년 이후 전 세계 볼륨이 25% 증가했습니다.

회사는 11월 이후 구성 프로토콜을 개정하여 동적으로 생성된 파일에 대한 자동화된 테스트를 구현했습니다. 그러나 반복적으로 발생하면 병렬 유지 관리 중 확장성에 문제가 발생합니다.

컨설팅 보고서에 따르면 이와 같은 중단으로 인해 비즈니스 고객의 경우 생산성 및 매출 손실로 인해 분당 평균 미화 9,000달러의 비용이 발생하는 것으로 나타났습니다.

완화 조치 채택

Cloudflare 기술자는 유럽과 아시아의 보조 데이터 센터에서 장애 조치 경로를 활성화하여 영향을 받는 트래픽의 60%를 20분 이내에 리디렉션했습니다. 상태 API를 통한 실시간 모니터링을 통해 전파를 방지하기 위해 작업자 스크립트를 격리했습니다.

고객은 오전 9시(UTC)에 대시보드를 통해 경고를 받았고 영향을 최소화하기 위해 로컬 캐시를 사용할 것을 권고했습니다. 회사는 디트로이트와 시카고 노드에서 용량을 15% 확장하여 더 이상의 오류 없이 오후 1시(UTC)에 유지 관리를 완료했습니다.

개발자는 API 호출에서 재시도를 구현하여 타사 통합의 오류를 줄이도록 권고 받았습니다. Zoom과 같은 플랫폼은 UTC 10시 30분에 전체 서비스를 복원하여 글로벌 테스트에서 안정성을 확인했습니다.

향후 안정성에 대한 전망

12월에 계획된 소프트웨어 업데이트에는 유사한 버그를 제거하는 것을 목표로 봇 구성에 대한 이중 검증이 포함됩니다. Cloudflare는 2025년 네트워크 확장에 5억 달러를 투자하여 50개의 새로운 데이터 센터를 추가했습니다.

인프라 전문가는 위험을 완화하기 위해 공급자 다양화를 권장하지만, 대규모 플랫폼의 80%에서 Cloudflare에 대한 의존도가 지속되고 있습니다. PagerDuty와 같은 도구를 통한 지속적인 모니터링은 이제 사전 경고를 위한 웹후크를 통합합니다.

전체 복원은 오전 11시(UTC)에 이루어졌으며 도메인의 95%에서 트래픽이 정상으로 돌아왔습니다. 회사는 앞으로 24시간 이내에 공식 블로그에 교훈을 자세히 설명하는 자세한 보고서를 게시할 예정입니다.

사용자와 기업의 반응

비즈니스 사용자들은 개발자 포럼에서 충돌 재발에 대한 우려를 표명했습니다. 전자상거래 사이트의 IT 팀은 피크 기간 동안 약 200만 달러의 손실을 입었다고 보고했습니다.

Shopify와 같은 영향을 받는 플랫폼은 판매자에게 오프라인 백업을 제안하는 내부 권고를 발표했습니다. 협업 부문에서 Notion은 프리미엄 가입자를 위한 상태 업데이트를 우선시했습니다.

사이버 보안 커뮤니티는 Cloudflare가 최근 29.7 Tbps DDoS를 차단한 것을 보면 아이러니함을 강조했습니다. 전문 네트워크에서의 논의에서는 중요한 인프라의 이중화 필요성을 강조합니다.

글로벌 네트워크 확장

Cloudflare는 310개 도시에서 운영되고 있으며 이는 전 세계 연결된 인구의 95%를 담당합니다. 2025년에는 처리된 트래픽이 월간 100엑사바이트에 도달했는데, 이는 2024년에 비해 30% 증가한 수치입니다.

엣지 컴퓨팅에 대한 투자로 로컬 처리가 가능해 아시아 태평양 사용자의 대기 시간이 40% 단축됩니다. 보고타와 산티아고의 현지 사업자와의 파트너십을 통해 라틴 아메리카 지역까지 확대되었습니다.

회사는 GDPR 및 LGPD와 같은 규정을 준수하여 전송되는 데이터의 개인정보를 보호합니다. 엣지 암호화에 대한 최근 업데이트는 도청으로부터 연결의 99.99%를 보호합니다.

To Top