RUDA DIRECTOR / 데이터 해석·실무
Top 5 차트에서 일부 항목을 숨긴 뒤 남은 항목만으로 비율을 다시 계산하면, ‘전체에서 차지하는 비중’이 ‘상위 5개 안에서의 비중’으로 바뀐다. 두 계산 모두 쓸 수 있다. 다만 제목과 분모가 서로 맞아야 한다.
이 차이는 차트를 단정하게 만드는 과정에서 생기기 쉽다. 열 개 항목을 다섯 개로 줄였는데 제목은 여전히 ‘전체 주문 비중’이다. 막대의 순서는 맞고 합계도 100%여서 오류처럼 보이지 않는다. 그러나 사용자는 보이지 않는 항목까지 포함한 전체를 보고 있다고 생각할 수 있다.
같은 240건이 24%와 34.3%로 보이는 이유
아래는 계산을 설명하기 위해 만든 가상 데이터다. 특정 제품의 실적이나 실험 결과가 아니다. 한 달의 주문 1,000건을 열 개 유형으로 나눴으며, 주문 한 건은 정확히 한 유형에만 속한다. A부터 J까지의 건수는 240, 180, 120, 90, 70, 65, 65, 60, 55, 55건이다.
| 표시 항목 | 주문 수 | 전체 1,000건 중 비중 |
|---|---|---|
| A | 240건 | 24% |
| B | 180건 | 18% |
| C | 120건 | 12% |
| D | 90건 | 9% |
| E | 70건 | 7% |
| 기타 5개 유형 | 300건 | 30% |
| 합계 | 1,000건 | 100% |
상위 다섯 항목은 700건이다. 전체 대비 A의 비중은 240 ÷ 1,000 = 24%다. 표시된 다섯 항목의 합계만 분모로 쓰면 240 ÷ 700 ≈ 34.3%가 된다. 주문은 늘지 않았고, 계산에서 바라보는 범위만 좁아졌다.

| A의 비중을 묻는 질문 | 계산과 결과 |
|---|---|
| 전체 주문 중 A는 얼마인가? | 240 ÷ 1,000 = 24% |
| 상위 5개 유형에 속한 주문 중 A는 얼마인가? | 240 ÷ 700 ≈ 34.3% |
‘전체 주문의 34.3%가 A다’라고 쓰면 틀린다. ‘상위 5개 유형에 속한 주문의 34.3%가 A다’라고 쓰면 이 예제에서는 맞다. 반올림으로 생긴 차이가 아니라 질문 자체의 차이다.
표시를 줄이는 일과 분석 대상을 줄이는 일을 구분한다
Top N은 두 가지 용도로 쓰인다. 전체를 이해시키면서 눈에 보이는 항목 수만 줄일 수도 있고, 상위 집단만 따로 분석할 수도 있다. 전자라면 전체 분모를 유지하고, 후자라면 좁혀진 분석 범위를 제목에 명시한다.
| 독자가 판단할 내용 | 화면에서 유지할 정보 |
|---|---|
| 전체가 상위 유형에 얼마나 집중됐는가 | 전체 1,000건, 상위 5개 700건·70%, 기타 300건·30% |
| 상위 유형끼리 어떤 차이가 있는가 | 상위 5개 합계 700건과 그 집단 안의 비중 |
| 우선 볼 항목은 무엇인가 | 상위 항목의 순위·건수, 생략한 항목 수와 전체 상세로 가는 경로 |
이 구분은 특정 도구에만 해당하지 않는다. 다만 구현 순서는 도구마다 확인해야 한다. Tableau 공식 문서는 차원 필터가 Percent of Total 같은 테이블 계산보다 먼저 적용될 수 있음을 보여준다. 따라서 화면에서 항목을 제외하는 방식에 따라 계산에 남는 데이터가 달라질 수 있다. Tableau의 계산·필터 적용 순서를 참고하되, 다른 도구에서도 같은 순서라고 가정하지는 말자.
‘기타’는 여섯 번째 경쟁자가 아니다
전체 구성을 보여줘야 한다면 ‘기타’를 남기는 편이 유용하다. Tableau도 상위 N개를 개별 표시하고 나머지를 하나의 Others 항목으로 묶는 집합 구성 방법을 제공한다.
다만 이 예제의 ‘기타 300건’은 단일 유형 A의 240건보다 크다. 기타를 다른 항목과 함께 내림차순으로 정렬해 1위에 놓으면 서로 다른 단위가 섞인다. A부터 E는 개별 유형이고 기타는 다섯 유형의 합계다.
이 글에서 제안하는 표현은 상위 5개 유형을 순위대로 배치한 뒤, ‘기타 5개 유형 · 300건 · 30%’를 구분해 덧붙이는 것이다. 기타에는 순위 번호를 붙이지 않는다. 막대로 표현한다면 같은 건수 축을 쓰되, 개별 항목과 합산 항목의 경계를 라벨과 여백으로 드러낸다. 색만으로 구분하지 않아야 한다.
반대로 전체 비중이 아니라 상위 다섯 항목의 작업 순서만 필요한 화면이라면 기타 막대를 생략할 수 있다. 이때도 ‘전체 10개 유형 중 상위 5개 표시’처럼 생략 범위를 알려야 한다. 기타를 늘 표시하는 것이 목표는 아니다.
필터·동률·결측에서 기준을 고정한다
기간이나 지역을 바꾸는 필터는 순위를 정하기 전에 분석 대상 자체를 바꿀 수 있다. 사용자가 ‘서울의 상위 5개’를 요청했다면 서울 데이터 안에서 순위를 계산해야 한다. ‘전국 상위 5개가 서울에서 얼마나 발생했는가’는 다른 질문이다. 두 결과가 달라도 어느 쪽이든 자동으로 오류가 되는 것은 아니다.
마지막 순위가 동률이면 ‘동률을 모두 포함’할지 ‘정확히 N개만 표시’할지도 정해야 한다. 예제에서 Top 6를 만들면 F와 G가 각각 65건이다. 동률을 모두 포함하면 7개 항목이 된다. 정확히 6개를 유지한다면 보조 정렬 기준을 정하고 동률이 있다는 사실을 표시한다. 순위가 재조회 때마다 흔들리도록 두면 안 된다.
미분류·결측 항목은 정상적으로 분류된 하위 항목과 의미가 다르다. 이를 기타에 조용히 합치면 분류 품질 문제가 보이지 않는다. 전체에 포함할지 제외할지를 정한 뒤 ‘미분류’로 따로 보여준다. 전체가 0건인 상태에서 비중을 0%로 채우는 것도 피한다. 나눌 분모가 없으므로 ‘비중 계산 불가’가 더 정확하다.
합산이 가능한 지표에만 이 예제를 적용한다
주문 수처럼 같은 기준으로 나눠 더할 수 있는 지표라면 ‘상위 합계 + 기타 = 전체’를 검사할 수 있다. 중복 사용자를 포함한 고유 사용자 수, 평균, 전환율에 이 식을 그대로 적용해서는 안 된다. 평균은 원래 합계와 관측 수가 필요하고, 전환율은 성공 건수와 대상 건수가 필요하다. 음수가 가능한 지표도 ‘전체의 구성 비중’이라는 표현이 적절한지 별도로 판단해야 한다.
출시 전에는 Top N을 5에서 10으로 바꿔 본다. ‘전체 대비 비중’을 보여주는 화면이라면, 같은 분석 범위에서 A의 24%가 그대로 유지돼야 한다. 반대로 ‘표시 항목 내 비중’이라면 값이 바뀌는 것이 의도한 동작이다. 이 한 번의 비교로 차트가 어떤 질문에 답하는지 확인할 수 있다.
예제 검산: 상위 5개 700건 + 기타 300건 = 1,000건. 합성 데이터의 산술을 확인한 설명이며 실제 BI 제품 실행 결과나 사용자 실험을 뜻하지 않는다. 공식 문서 확인: 2026-09-30.
React 대시보드에 이 기준을 적용해 보려면 무료 대시보드 템플릿 KPI Kit의 데모·소스·사용 방법을 참고할 수 있다. 합성 예제 데이터를 실제 지표로 바꿀 때는 표시 항목 수보다 전체 분모와 필터 범위를 먼저 고정한다.