| r35 vs r36 | ||
|---|---|---|
| ... | ... | |
| 139 | 139 | 첫 번째 기간인 11:30~13:10은 Workers KV에 대한 영향 때문이었으며, 일부 제어 플레인 및 대시보드 기능이 이에 의존하고 있었습니다. 13:10에 Workers KV가 핵심 프록시 시스템을 우회하도록 설정되면서 복구되었습니다. |
| 140 | 140 | |
| 141 | 141 | 대시보드에 대한 두 번째 영향 기간은 feature configuration 데이터를 복원한 후 발생했습니다. 로그인 시도의 누적(backlog)이 대시보드를 압도하기 시작했고, 이 누적과 재시도 시도가 결합되면서 지연(latency)이 증가하고 대시보드 가용성이 감소했습니다. 제어 플레인 동시성(concurrency)을 확장하여 약 15:30에 가용성이 회복되었습니다. |
| 142 | ||
| 143 | {{{+5 복구 조치 및 후속 조치 단계}}} | |
| 144 | 시스템이 정상적으로 온라인 상태로 복구된 지금, 앞으로 이런 장애에 대비해 시스템을 강화하는 작업이 이미 시작되었습니다. 특히 다음과 같은 조치를 진행 중입니다: | |
| 145 | ||
| 146 | * Cloudflare가 생성한 구성 파일도, 사용자 입력처럼 엄격하게 검증하고 처리하도록 강화하고 있습니다. | |
| 147 | * 기능별로 더 많은 글로벌 킬 스위치를 활성화하여, 문제가 발생했을 때 신속히 시스템을 차단할 수 있도록 하고 있습니다. | |
| 148 | * 코어 덤프나 기타 오류 보고가 시스템 자원을 과도하게 사용하지 않도록 제한하고 있습니다. | |
| 149 | * 모든 핵심 프록시 모듈에서 오류 조건에 대한 실패 방식(failure mode)을 검토하고 있습니다. | |
| 150 | ||
| 151 | 오늘은 [[https://blog.cloudflare.com/details-of-the-cloudflare-outage-on-july-2-2019/|2019년 이후]] Cloudflare의 최악의 장애였습니다. 이전에도 [[https://blog.cloudflare.com/post-mortem-on-cloudflare-control-plane-and-analytics-outage/|대시보드가 사용 불가능]]해지거나, [[https://blog.cloudflare.com/cloudflare-service-outage-june-12-2025/|새로운 기능이 잠시 제공되지 못한 장애]]는 있었지만, 지난 6년 이상 동안 핵심 트래픽 대부분이 네트워크를 통해 흐르지 못한 장애는 이번이 처음입니다. | |
| 152 | ||
| 153 | 오늘과 같은 장애는 용납될 수 없습니다. Cloudflare는 항상 트래픽이 계속 흐르도록 시스템을 높은 수준으로 내결함성(resilience)을 갖추도록 설계해왔습니다. 과거의 장애에서도 항상 더 견고한 시스템을 구축하는 계기가 되었습니다. | |
| 154 | ||
| 155 | Cloudflare 전체 팀을 대표하여, 오늘 인터넷에 끼친 불편과 혼란에 대해 사과드립니다. | |
| 156 | ||
| 142 | 157 | == 에러 상황 == |
| 143 | 158 | {{{#!wiki style="border: 1px solid gray; border-top: 5px solid crimson; padding: 12px" |
| 144 | 159 | '''{{{+1 Cloudflare Global Network experiencing issues}}}''' |
| ... | ... |