성공률 100%가 95%보다 믿을 만할까: 표본 수가 다른 비율 비교

표본 수가 다른 성공률은 퍼센트만으로 순위를 정하면 안 된다. 성공 건수/시도 수를 함께 표시하고, 최소 성공률 충족을 판단해야 하는 Decision이라면 사전에 정한 방법으로 계산한 95% 양측 Wilson 하한을 기준과 비교한다.

3번 중 3번 성공한 100%와 1,000번 중 950번 성공한 95%가 있다. KPI 카드만 보면 100%가 더 좋아 보인다. 그러나 첫 값은 실패를 아직 보지 못한 세 번의 관측이고, 두 번째 값은 50번의 실패까지 포함한 1,000번의 관측이다. 이 글의 질문은 “어느 숫자가 더 큰가”가 아니라 “최소 90%의 성공률을 요구하는 판단에 어느 Evidence가 충분한가”다.

합성 사례 — 성공 정의가 같은 네 검증 결과를 비교한다

아래 수치는 설명을 위해 만든 합성 QA 결과다. 실제 제품·고객·출시·성과와 관계없다. 네 검증은 같은 조건에서 한 번의 시도가 성공 또는 실패 중 하나로 끝나고, 각 시도가 서로 독립이라는 단순한 binomial 가정을 둔다. 최소 판단선 90%도 설명용 정책이다.

검증성공/시도관측 성공률
A3/3100.0%
B19/2095.0%
C95/10095.0%
D950/1,00095.0%
관측 성공률은 성공 수 ÷ 시도 수다. 같은 95%라도 관측량은 20·100·1,000회로 다르다.

관측 성공률은 틀리지 않았다. 빠진 것은 그 비율이 몇 번의 관측에서 나온 값인지다. 이를 보완하기 위해 이 글은 각 비율에 95% Wilson score interval을 계산한다. 계산 방법은 네 행에 동일하게 적용한다.

합성 성공률 네 사례의 관측값과 95% Wilson interval 비교. A 3/3은 100.0%이며 구간 43.9~100.0%, B 19/20은 95.0%이며 76.4~99.1%, C 95/100은 95.0%이며 88.8~97.8%, D 950/1000은 95.0%이며 93.5~96.2%다. 90% 최소 판단선은 D의 구간 하한만 넘는다.
합성 사례의 관측 성공률(점)과 95% Wilson interval(선). 같은 성공 정의와 독립 시행을 가정했다. 90%는 설명용 최소 판단선이다.
검증95% 양측 Wilson interval양측 하한 ≥90%?
A · 3/343.9%–100.0%아니오
B · 19/2076.4%–99.1%아니오
C · 95/10088.8%–97.8%아니오
D · 950/1,00093.5%–96.2%예
소수점 첫째 자리 반올림. 이 합성 정책은 95% 양측 Wilson interval의 하한을 최소 90% 판단선과 비교한다.

A는 관측값이 100%지만 interval이 가장 넓다. 성공 세 번만으로 가능한 범위를 좁히기 어렵기 때문이다. B·C·D는 모두 관측값이 95%지만, 시도가 늘어날수록 interval이 좁아진다. “관측값이 90%를 넘었는가”와 “최소 90%라는 정책을 뒷받침할 만큼 Evidence가 쌓였는가”는 다른 질문이다.

Decision — 관측값, Evidence 양, 판단선을 한 문장에 섞지 않는다

Minimum-rate Decision Path

  1. Define: 성공·실패 단위, 대상, 기간, 제외 조건을 고정한다.
  2. Observe: 퍼센트보다 먼저 성공 수/시도 수를 표시한다.
  3. Estimate: 네 결과에 같은 interval 방법·confidence level·양측/단측 규칙을 적용한다.
  4. Compare: 관측값이 아니라 사전에 정한 95% 양측 Wilson 하한을 최소 판단선과 비교한다.
  5. Act: 기준 미달이면 “성능 실패”와 “Evidence 부족”을 분리하고 다음 시도 수·중단 조건을 정한다.

이 경로는 90%를 보편적인 기준으로 제안하지 않는다. 실제 기준은 실패 영향·실행 비용·업무 정책에서 정해야 한다.

D는 관측 성공률 95.0%, 95% 양측 Wilson 하한 93.5%여서 이 합성 정책을 통과한다. C는 같은 95.0%지만 양측 하한 88.8%여서 통과하지 않는다. 이때 C를 “실패한 버전”이라고 부르면 과장이다. 더 정확한 상태는 관측값은 목표 위, 이 합성 정책의 최소 기준을 뒷받침하기에는 Evidence 부족이다.

왜 단순한 ± 오차 대신 Wilson interval을 선택했는가

관측 비율을 p̂=x/n, 95% 양측 기준값을 z=1.96으로 두면 Wilson interval은 다음 식으로 재현할 수 있다. 아래 식의 값은 퍼센트가 아니라 0과 1 사이의 비율이다.

den = 1 + z²/n
center = (p̂ + z²/(2n)) / den
half = z × sqrt(p̂(1-p̂)/n + z²/(4n²)) / den
interval = [center - half, center + half]

단순 Wald 식 p̂ ± z√(p̂(1−p̂)/n)은 A처럼 p̂=1이면 표준오차가 0이 돼 100%–100%라는 0폭 구간을 만든다. 관측이 세 번뿐인데 불확실성이 없다고 보이는 결과다. 이 글은 그 경계 문제를 피하고 같은 규칙으로 네 행을 계산하기 위해 Wilson 방법을 선택했다.

statsmodels 0.15.1 개발 문서는 binomial proportion interval의 입력을 성공 수(count)와 전체 시도 수(nobs)로 정의하고 Wilson을 지원 방법 중 하나로 명시한다. 이 글의 계산은 문서 확인일 2026-10-04 기준으로 식을 직접 다시 계산했으며, 특정 software 실행 결과만을 근거로 삼지 않았다. Wilson 방법의 원 논문은 E. B. Wilson의 1927년 논문이다.

포기한 안 — 최소 표본 수 하나와 성공률 순위만 남기지 않는다

대안포기한 이유
성공률만 내림차순 정렬3/3의 100%를 950/1,000의 95%보다 강한 Evidence처럼 보이게 한다.
시도 100회 이상이면 통과관측 성공률과 허용 실패 수준을 반영하지 못한다. 80/100과 99/100을 같은 Evidence 양만으로 처리한다.
성공률과 표본 수를 한 score로 합산가중치가 실패 비용과 연결되지 않으면 정밀한 숫자가 판단 근거를 숨긴다.
관측값 + 동일한 ±5%p표본 수가 달라도 폭이 같아지고 0%·100% 경계에서 가능한 범위를 왜곡한다.

고정된 최소 시도 수가 무용하다는 뜻은 아니다. 운영상 너무 이른 결정을 막는 Guardrail로 둘 수 있다. 다만 최종 판단에서는 성공 정의, 관측값, 불확실성, 실패 비용을 함께 봐야 한다.

WHEN NOT TO APPLY — interval 하나로 해결되지 않는 조건

  • 시도가 독립이 아닐 때: 같은 장애가 연속 요청을 함께 실패시키면 n번의 독립 시행이라는 가정이 깨진다. 세션·사용자·날짜 단위의 군집을 먼저 확인한다.
  • 대상이 선택돼 있을 때: 쉬운 사례만 QA에 넣었다면 좁은 interval도 실제 Traffic을 대표하지 못한다. 표본 추출 범위 문제는 표본 수로 고칠 수 없다.
  • 기간 중 조건이 바뀔 때: 배포·정책·입력 분포가 달라졌다면 1,000회를 한 비율로 합치지 않는다. 변경 전후 Scope를 분리한다.
  • 단측 기준을 쓰는 정책: 이 글은 95% 양측 interval의 하한을 사용했다. 95% 단측 Wilson 하한을 쓰면 C는 약 90.1%로 판정이 바뀐다. confidence level과 양측/단측 규칙은 결과를 보기 전에 정한다.
  • 두 Variant의 차이를 검정할 때: 각 하한을 순서대로 세우는 것만으로 두 비율의 차이가 확인되는 것은 아니다. 차이 자체의 interval이나 사전에 정한 비교 검정을 사용한다.
  • 실패가 드물지만 치명적일 때: 평균 성공률이 높아도 보안·결제·안전 실패는 별도 Severity와 중단 규칙이 필요하다.
  • 전체 모집단을 완전히 검사했을 때: 표본 추정 문제가 아니라 관측된 전체의 실패 건수와 범위를 보고한다. 미래 운영의 불확실성과 현재 전체 집계는 구분한다.

대시보드에 남길 최소 표시 계약

필드화면에 답할 질문
Success definition무엇을 한 번의 성공·실패로 세는가?
Count성공 수/전체 시도 수가 얼마인가?
Observed rate관측된 비율은 얼마인가?
Interval method어떤 방법·confidence level·양측/단측 규칙을 썼는가?
Scope대상·기간·필터·변경 시점이 무엇인가?
Decision floor어떤 경계에서 어떤 Action이 바뀌는가?
Evidence state성능 미달인가, Evidence 부족인가, 통과인가?

Decision Rule: 표본 수가 다른 성공률을 비교할 때는 퍼센트 순위를 먼저 만들지 않는다. 성공 수/시도 수를 공개하고, 최소 성공률 충족을 판단하는 Decision에는 사전에 정한 interval 방법·confidence level·양측/단측 규칙을 동일하게 적용한다. 이 글처럼 95% 양측 Wilson 하한이 기준 아래라면 성능 미달과 Evidence 부족을 구분한다.

지표를 어떤 Decision과 연결할지는 KPI 대시보드 설계에서, 비율 차이를 %와 %p로 정확히 쓰는 법은 퍼센트와 퍼센트포인트 차이에서 이어진다. 관측값이 0인지 데이터가 없는지부터 불분명하다면 0과 데이터 없음은 다르다를 먼저 확인할 수 있다.

근거와 범위

3/3, 19/20, 95/100, 950/1,000과 최소 판단선 90%는 설명을 위해 만든 합성 값이다. interval은 95% 양측 Wilson score 방법, z=1.9599639845로 계산해 소수점 첫째 자리에서 반올림했다. 이 사례는 실제 제품 성능·고객 결과·출시 기준을 주장하지 않는다. 실제 적용 전에는 성공 정의, 독립성, 표본 추출, 기간 중 조건 변경, 실패 Severity를 별도로 검토해야 한다.


다른 글 보기 · 주제 탐색 · 작성자와 편집 기준 · 문의·정정 요청

RUDA DIRECTOR에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기