| r67 vs r68 | ||
|---|---|---|
| ... | ... | |
| 92 | 92 | |
| 93 | 93 | [[파일:클플 오류6.png|width=100%]] |
| 94 | 94 | |
| 95 | {{{+5 쿼리 동작 변경}}} | |
| 95 | '''{{{+5 쿼리 동작 변경}}}''' | |
| 96 | 96 | |
| 97 | 97 | 앞서 언급했듯, 기본 쿼리 동작 변경으로 인해 feature 파일에 중복된 행이 많이 포함되게 되었습니다. 문제의 데이터베이스 시스템은 ClickHouse 소프트웨어를 사용합니다. |
| 98 | 98 | |
| ... | ... | |
| 124 | 124 | |
| 125 | 125 | 하지만 사용자에게 추가 권한을 부여한 결과, 이제 쿼리 응답에는 r0 스키마의 모든 메타데이터가 포함되게 되었고, 그로 인해 응답 행 수가 사실상 두 배 이상 늘어나 최종 파일 출력에서 feature 수에도 영향을 미쳤습니다. |
| 126 | 126 | |
| 127 | {{{+5 메모리 사전 할당}}} | |
| 127 | '''{{{+5 메모리 사전 할당}}}''' | |
| 128 | 128 | |
| 129 | 129 | 프록시 서비스에서 실행되는 각 모듈에는 메모리 사용을 무한대로 늘어나지 않도록 제한하고, 성능 최적화를 위해 메모리를 사전 할당(preallocation) 하는 여러 제한이 설정되어 있습니다. |
| 130 | 130 | |
| ... | ... | |
| 138 | 138 | |
| 139 | 139 | {{{thread fl2_worker_thread panicked: called Result::unwrap() on an Err value}}} |
| 140 | 140 | |
| 141 | {{{+5 사건 발생 동안의 기타 영향}}} | |
| 141 | '''{{{+5 사건 발생 동안의 기타 영향}}}''' | |
| 142 | 142 | |
| 143 | 143 | 사건 발생 동안 핵심 프록시에 의존하는 다른 시스템들도 영향을 받았습니다. 여기에는 Workers KV와 Cloudflare Access가 포함됩니다. 팀은 13:04에 Workers KV를 패치하여 핵심 프록시를 우회하도록 했고, 이후 이들 시스템과 Workers KV에 의존하는 모든 하위 시스템(예: Access)에서 오류율이 줄어들었습니다. |
| 144 | 144 | |
| ... | ... | |
| 152 | 152 | |
| 153 | 153 | 대시보드에 대한 두 번째 영향 기간은 feature configuration 데이터를 복원한 후 발생했습니다. 로그인 시도의 누적(backlog)이 대시보드를 압도하기 시작했고, 이 누적과 재시도 시도가 결합되면서 지연(latency)이 증가하고 대시보드 가용성이 감소했습니다. 제어 플레인 동시성(concurrency)을 확장하여 약 15:30에 가용성이 회복되었습니다. |
| 154 | 154 | |
| 155 | {{{+5 복구 조치 및 후속 조치 단계}}} | |
| 155 | '''{{{+5 복구 조치 및 후속 조치 단계}}}''' | |
| 156 | 156 | 시스템이 정상적으로 온라인 상태로 복구된 지금, 앞으로 이런 장애에 대비해 시스템을 강화하는 작업이 이미 시작되었습니다. 특히 다음과 같은 조치를 진행 중입니다: |
| 157 | 157 | |
| 158 | 158 | * Cloudflare가 생성한 구성 파일도, 사용자 입력처럼 엄격하게 검증하고 처리하도록 강화하고 있습니다. |
| ... | ... |