r91 vs r92
......
505505
We are working to understand the full impact and mitigate this problem.
506506
{{{-2 {{{#gray Nov 18, 2025 - 11:17 UTC}}}}}}}}}
507507
508
=== 요약 ===
509
2025년 11월 18일, Cloudflare는 전 세계 네트워크에서 심각한 장애가 발생했다는 사실을 공지했다. 장애는 UTC 기준 11시 20분경부터 시작되었고, 전 세계 사용자들이 Cloudflare를 통해 제공되는 웹사이트에 접속할 때 HTTP 5xx 에러를 경험하게 되었으며, 일부 서비스는 거의 완전히 중단된 상태가 되었더다. 이번 장애의 직접적인 원인은 내부 데이터베이스인 ClickHouse 클러스터에서 권한 관련 설정을 변경하면서 발생한 것으로, 이 변경으로 인해 봇 관리(Bot Management) 시스템이 사용하는 feature file에 중복 항목이 대량으로 생성되었고, 파일 크기가 평소보다 두 배 이상 커지면서 글로벌 서버에 배포되는 과정에서 문제가 확대되었더다. 이 과정에서 봇 관리 모듈이 허용된 기능 수를 초과하면서 네트워크 전반에 5xx 오류가 대량으로 발생했고, 일부 내부 시스템은 이를 외부 DDoS 공격으로 오인하기도 했으며, 새 프록시 엔진(FL2)과 기존 구 버전 프록시(FL) 모두 어느 정도 영향을 받았다.
510
511
장애로 인해 CDN 서비스와 보안 서비스는 많은 HTTP 5xx 오류를 기록했고, Workers KV 서비스 또한 프록시 장애의 영향으로 오류율이 크게 상승했으며, 사용자 대시보드 로그인이 정상적으로 이루어지지 않아 11시 30분부터 13시 10분, 그리고 14시 40분부터 15시 30분 사이에 로그인 불가 현상이 발생했더다. 또한 Access 인증 서비스도 영향을 받아 인증 실패가 증가했으며, 구성 업데이트가 지연되었다.
512
513
장애 대응 과정에서 Cloudflare는 우선 11시 28분경에 이상 징후를 감지하였고, 13시 5분에는 Workers KV 및 Access 관련 우회 조치를 시행하였으며, 14시 24분에서 14시 30분 사이에 정상 버전의 feature file을 재배포하고 자동 생성 기능을 중단함으로써 점진적인 안정화를 이루었으며, 결국 17시 6분경에 모든 서비스가 완전히 복구되었다고 보고했다.
514
515
이번 장애를 Cloudflare는 2019년 이후 가장 심각한 핵심 트래픽 중단 사건으로 평가하였으며, 향후 재발 방지를 위해 설정 파일 수신 및 배포 과정의 강화, 글로벌 킬 스위치 도입, 오류 보고 및 코어 덤프 분석을 통한 과다 자원 사용 방지, 프록시 모듈 전반의 실패 모드 검토 등 다양한 개선 조치를 계획하고 있다고 밝혔다.
516
517
결국 이번 사건은 내부 설정 변경 하나가 전 세계 네트워크에 얼마나 큰 영향을 줄 수 있는지를 보여주었으며, 시스템 운영과 모니터링, 장애 대응 프로세스의 중요성을 다시금 일깨워주는 사례가 되었다고 정리할 수 있다.
518
508519
== 비판 ==
509520
[[파일:클플 오류8.png|width=100%]]
510521
애초에 해당 코드는 Rust에서 절대 권장하지 않는 코드로 해당을 사용한 것에 대한 비판이 매우 많다.
......