r19
| 1 | [[분류:명세]] |
|---|
r20
| 2 | [목차] |
|---|
| 3 | == collision probability research == |
|---|
r18
| 4 | 유니코드 기준 현대 한글의 모든 완성형 글자는 총 [math(19 \times 21 \times 28 = 11,172)]자이며, [math(4)]개의 문자가 연달아 사용되므로 표본 공간의 크기는 |
|---|
r1
| 5 | |
|---|
r18
| 6 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(11,172^4 = 15,578,430,750,925,056 \approx 1.5578430751 \times 10^{16})]|| |
|---|
r1
| 7 | |
|---|
r8
| 8 | 입니다. 편의상 이를 [math(N)]이라고 하겠습니다. |
|---|
r3
| 9 | |
|---|
r9
| 10 | 하나의 작업에서 [math(x)]개의 식별자를 생성했을 때, 이중 '적어도 하나의 식별자 충돌이 발생할 확률'을 구하고자 합니다. 이 확률을 [math(p)]로 둡시다. 예를 들어 [math(p = 30\%)]라면 대략 [math(30\%)]의 확률로 충돌이 발생할 가능성이 있다는 뜻입니다. |
|---|
r3
| 11 | |
|---|
r21
| 12 | 이어서 실제로 나무위키 모든 문서를 대상으로 하는 1회의 작업을 수행하였을 때, 동일 작업 내에서 식별자 충돌이 발생할 실제 확률 [math(p)]를 구하고자 합니다. 단순한 비교를 위해 테일러 전개로 적절한 하한을 찾아 근사하도록 합니다. 일단 자명하게 |
|---|
r9
| 13 | |
|---|
r10
| 14 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(\displaystyle p = 1 - \frac{_N\mathrm P_x}{N^x})]|| |
|---|
r4
| 15 | |
|---|
r22
| 16 | 이므로 우변의 [math(\frac{_N\mathrm P_x}{N^x})] 부분을 근사하는 어떤 함수 [math(f(x))]를 찾은 후 [math(1 - f(x))]를 구하면 [math(p)]의 근사값을 얻을 수 있습니다. 우선 [math(\frac{_N\mathrm P_x}{N^x})] 수식을 곱의 형태로 정리해 봅시다. |
|---|
r4
| 17 | |
|---|
r10
| 18 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(\displaystyle 1 - p = \prod^{x-1}_{k = 1} 1 - \frac kN)]|| |
|---|
r6
| 19 | |
|---|
r23
| 20 | 이어서 [math(\exp -\frac kN)]을 테일러 전개하고 선형 근사를 구하면 |
|---|
r6
| 21 | |
|---|
r23
| 22 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(\displaystyle \exp -\frac kN = \sum_{i = 0} \frac{\left(-\frac kN\right)^i}{i!} \approx 1 - \frac kN)]|| |
|---|
r6
| 23 | |
|---|
r8
| 24 | 이 근사를 적용해서 '어떤 함수' [math(f(x))]가 [math(1 - p)]를 근사하도록 조립해 봅시다. |
|---|
r7
| 25 | |
|---|
r24
| 26 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(\displaystyle f(x) = \exp -\frac{x(x-1)}{2N} = \exp \sum^{x - 1}_{k = 1} -\frac kN = \prod^{x - 1}_{k = 1} \exp -\frac kN \approx \prod^{x - 1}_{k = 1} 1 - \frac kN = 1 - p)]|| |
|---|
r7
| 27 | |
|---|
r25
| 28 | [[https://namu.wiki/w/나무위키:통계|나무위키:통계]]에 따르면 2025-05-08 20:04:05-0400 기준 나무위키의 모든 문서는 [math(7,149,087)]개 가량입니다. 앞서 구한 [math(f(x))]에 이 값을 집어넣으면 나무위키의 모든 문서를 대상으로 하는 작업을 수행했을 해당 작업 내에서 식별자 충돌이 발생할 확률 [math(p)]를 구할 수 있습니다. |
|---|
| 29 | |
|---|
| 30 | ||<tablealign=center><tablebordercolor=transparent><tablebgcolor=transparent>[math(\displaystyle\begin{aligned} |
|---|
| 31 | p &= 1 - f(7,149,087) \\ |
|---|
| 32 | &= 1 - \exp -\frac{7,149,087 \times 7,149,086}{2 \times 15,578,430,750,925,056} \\ |
|---|
| 33 | &= 1 - 0.9983609536 \\ |
|---|
| 34 | &= 0.0016390464 \\ |
|---|
| 35 | &\approx 0.1639\% \\ |
|---|
| 36 | \end{aligned})]|| |
|---|
r26
| 37 | |
|---|