기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
파티션이 두 개 이상 필요한지 확인
모든 비컨은 기본적으로 파티션을 사용하여 파생됩니다. 가장 간단한 구성에서 비컨은 단일 파티션을 사용합니다. 추가 파티션을 사용하는 것은 스큐, 핫 값 및 주파수 누출을 해결하는 데 도움이 되는 튜닝 결정이지만 파티션당 한 번 쿼리를 실행해야 하므로 쿼리 팬아웃을 늘릴 수도 있습니다. 이 섹션에서는 단일 파티션이 충분한 시기와 여러 파티션을 구성해야 하는 시기를 설명합니다.
모집단 및 균일성으로 시작
비컨화하려는 속성을 평가하여 시작합니다.
-
모집단 크기: 비컨이 효과를 발휘하려면 비컨이 충분한 고유 값(예: 최소 32개의 고유 값)이 있는 필드에서 파생되어야 합니다. 이 요구 사항이 충족되지 않으면 파티션 수를 늘리면 값을 보다 효과적으로 분산하는 데 도움이 될 수 있습니다.
-
빈도 분포: 균일성 분석을 사용하여 속성의 분포가 대부분 균일한지 또는 눈에 띄는 왜곡이 표시되는지 평가합니다.
속성의 분포가 거의 균일한 경우 일반적으로 단일 파티션으로 충분합니다. 배포가 왜곡되거나 명확한 핫 값이 포함된 경우 둘 이상의 파티션을 구성하는 것이 좋습니다.
여러 파티션이 권장되는 경우
다음 조건 중 하나 이상이 적용되는 경우 둘 이상의 파티션을 구성하는 것이 좋습니다.
-
핫 값 또는 핫 비컨: 소수의 값이 다른 값보다 훨씬 더 자주 나타납니다(예: 매우 일반적인 성). 이러한 값은 매우 큰 동일한 비컨 그룹을 생성하므로 다른 값과 쉽게 구별할 수 있습니다.
-
고르지 않은 데이터 분포: 일부 값은 매우 자주 나타나는 반면, 많은 값은 몇 번만 나타납니다. 이러한 드문 값은 다른 값과 블렌딩할 수 있을 만큼 자주 발생하지 않으므로 충분히 큰 그룹 내에서 값을 보호하는 것이 더 어렵습니다.
-
비컨 길이가 더 길어야 함: 비컨 길이를 더 길게 사용하면 쿼리 정확도가 향상되지만 충돌 가능성은 줄어듭니다. 파티셔닝은 여러 파티션에 값을 분산하여 충돌을 유지하는 데 도움이 됩니다. 각 파티션에는 자체 비컨 공간이 있으므로 동일한 값이 서로 다른 파티션의 서로 다른 값과 충돌하여 프라이버시와 정밀도의 균형을 맞출 수 있습니다.
-
속성에 대한 대량 검색: 속성은 자주 쿼리되며 거짓 긍정은 비용이 많이 듭니다. 파티셔닝을 사용하면 비컨 길이를 늘려 오탐을 줄이는 동시에 허용 가능한 개인 정보 보호를 유지할 수 있습니다.
단일 파티션으로 충분한 경우
다음과 같은 경우 단일 파티션을 사용하는 것이 적절할 수 있습니다.
-
속성의 분포는 거의 균일하며 균일성 검사를 통과합니다.
-
속성은 검색 조건자로 거의 사용되지 않거나 거짓 긍정 및 빈도 누출은 중요한 문제가 아닙니다.
이러한 경우 단일 파티션으로 속성을 구성하는 것이 더 간단하며 추가 쿼리 팬아웃을 방지합니다.
일반적으로 속성이 비컨화에 적합하지만 단일 파티션으로 충족할 수 없는 스큐, 핫 값 또는 익명 제약 조건을 나타내는 경우 여러 파티션을 구성하면 더 안전하고 유연한 솔루션이 제공됩니다.