AI가 확신하는 답만 자동으로 내보내려면, 선택한 답의 오류율과 보류된 업무량을 함께 재야 한다. 자동 답변을 줄였다는 사실만으로 전체 서비스가 더 정확해지지는 않는다. 답하지 않은 일을 누가, 언제, 어떤 기준으로 마칠지도 같은 설계 안에 있어야 한다.
이전 AI Agent Fast Learning은 자신감 점수가 실제 결과와 맞는지 살폈다. 이번에는 그 점수를 자동 처리와 검토 대기로 나누는 기준에 사용해 본다. 아래 문서 답변 12건은 교육용으로 만든 합성 기록이다. 실제 모델의 응답이나 운영 성능을 측정한 자료가 아니다.
잘 고른 답과 많이 처리한 일을 나눠 본다
가상의 문서 답변 에이전트가 답안과 점수 s를 만든다고 하자. 이 글의 정답 기준은 “지정 문서의 근거와 답변의 핵심 주장이 일치한다”다. 모든 사례의 답안·점수를 먼저 고정하고, 별도 정답 기준으로 맞고 틀림을 판정했다고 가정한다. 점수는 높은 답안을 먼저 선택하기 위한 값이며, 0.9가 검증된 성공확률 90%라는 뜻은 아니다.
점수가 임계값 이상이면 자동 처리 후보로 선택하고, 미만이면 답변을 보류한다. 이렇게 일부 사례에서 답을 보류하는 접근을 selective prediction, 선택적 예측이라고 부른다. Geifman과 El-Yaniv의 2017년 논문은 선택한 영역의 오류와 처리 범위를 함께 평가한다. 논문의 이미지 분류 실험이나 위험 보장을 여기의 문서 에이전트에 그대로 적용한 것은 아니다.
- 자동 선택 비율(coverage) = 선택된 사례 수 ÷ 전체 사례 수
- 선택 오류율(selective risk) = 선택된 사례 중 오답 수 ÷ 선택된 사례 수
- 보류량 = 전체 사례 수 − 선택된 사례 수
여기서 risk는 모든 종류의 피해를 합친 위험 점수가 아니다. 정답·오답을 0과 1로 구분하는 이 예시의 오류율이다. 또 coverage는 자동 경로로 보낸 비율이지, 올바르게 완료한 비율이 아니다. 선택된 사례가 0건이면 선택 오류율은 계산할 수 없으며, 0% 오류로 기록하지 않는다.
같은 12건에서 임계값을 바꿔 본다
다음 점수와 정답 여부는 모두 합성값이다. 1은 정답, 0은 오답이며 같은 위치의 값끼리 한 사례를 이룬다. 점수가 같은 사례는 이번 예시에는 없다. 실제로 동점이 있다면 포함 여부를 정해 두고 같은 규칙을 적용해야 한다.
점수: .99 .97 .94 .91 .88 .85 .82 .78 .73 .66 .59 .42 정답: 1 1 0 1 1 1 0 1 0 1 0 1 선택 규칙: s ≥ 임계값
| 임계값 | 자동 선택 비율 | 선택 오류율 | 보류량 |
|---|---|---|---|
| 0.95 | 2/12 · 16.7% | 0/2 · 0% | 10건 |
| 0.90 | 4/12 · 33.3% | 1/4 · 25% | 8건 |
| 0.80 | 7/12 · 58.3% | 2/7 · 28.6% | 5건 |
| 0.70 | 9/12 · 75% | 3/9 · 33.3% | 3건 |
| 0.00 | 12/12 · 100% | 4/12 · 33.3% | 0건 |
임계값 0.90에서는 12건 중 4건을 자동 경로로 보내며, 그중 1건이 틀린다. 따라서 자동 선택 비율은 33.3%, 선택 오류율은 25%다. 나머지 8건은 검토 대기로 남는다. 오류율 25%의 분모는 자동 선택 4건이다. 전체 12건의 최종 성공률이 75%라고 읽으면 안 된다.

0.95에서는 선택된 두 건이 모두 맞는다. 이 작은 표의 0/2를 미래에도 오류가 없다는 보장으로 바꿀 수는 없다. 임계값을 높였을 때 이 표의 오류율이 낮아진 구간이 있다고 해서, 더 엄격한 모든 임계값에서 반드시 낮아지는 것도 아니다. 예를 들어 0.94로 올리면 정답인 0.91 사례가 빠져 1/3, 약 33.3%가 된다. 선택 수는 줄지만 관측 오류율은 25%보다 높다.
보류는 완료가 아니다
임계값을 0.80에서 0.90으로 바꾸면 자동 선택은 7건에서 4건으로 줄고 보류는 5건에서 8건으로 늘어난다. 이 합성 기록에서는 자동 경로에 남은 오답도 2건에서 1건으로 줄어든다. 하지만 세 건이 검토 경로로 더 넘어갔으므로, 그 일을 처리할 여력이 있는지는 별도 질문이다.
검토자에게 보냈다는 기록은 검토 완료가 아니다. 사람이 고친 답의 정확성도 자동으로 100%가 되지 않는다. 여기서는 보류된 8건에 대한 사람의 검토·수정·응답 시간을 측정하지 않았다. 합성 기록에 원래 모델 답의 정답 여부가 있어도, 검토 경로를 거친 최종 결과까지 관측한 것은 아니다.
전체 서비스를 평가하려면 들어온 요청에 같은 추적 ID를 붙여 자동 선택, 보류, 검토 완료, 최종 실패와 미완료를 연결하는 편이 좋다. 다음 항목은 이 문서 답변 서비스에 대한 설계 제안이다.
- 전체 접수량과 자동 선택량: 분모가 되는 기간·업무 범위를 고정한다.
- 자동 경로: 정답·오답 수를 선택된 건수와 함께 남긴다.
- 검토 경로: 유입량·완료량·아직 남은 건수와 대기시간을 남긴다.
- 최종 결과: 자동 경로와 검토 경로를 합치되, 미완료를 성공으로 채우지 않는다.
검토 대기가 쌓였을 때 임계값을 자동으로 낮추는 것까지 이 예시가 권하는 것은 아니다. 허용할 오류, 처리 기한과 검토 인력을 함께 보고 정해야 한다. 중요한 실행의 승인 조건은 점수 분기보다 먼저 적용한다. 점수가 높아도 요청받지 않은 발송이나 결제의 권한이 생기지는 않는다.
정답을 본 표에서 좋은 숫자를 골랐다면
위 표는 모든 정답을 알고 만든 설명용 계산이다. 이 표에서 오류율이 가장 낮은 임계값을 고른 뒤 같은 표로 성능을 주장하면, 선택과 평가가 같은 자료에 기대게 된다. 실제 운영 기준을 정할 때는 점수 생성 규칙을 고정하고 기준을 고를 자료와 마지막 성능 확인에 쓸 자료를 분리해야 한다.
scikit-learn의 임계값 조정 문서도 예측 모델과 행동 기준을 구분하고, 모델 학습과 임계값 조정에 같은 자료를 쓰는 과적합 위험을 경고한다. 그 문서의 이진 분류 도구를 문서 답변 에이전트에 적용해 시험한 것은 아니다. 여기서는 자료 분리 원칙만 참고한다.
작은 표본의 불확실성은 오류가 한 번도 없을 때의 표본 해석에서 이어 볼 수 있다. 업무 종류나 문서 범위가 바뀌면 전체 평균뿐 아니라 바뀐 업무에서의 자동 선택 비율과 오류율도 다시 확인해야 한다. 어제 고른 임계값이 오늘의 업무 구성에서도 같은 결과를 내는지는 이 합성 표로 알 수 없다.
산술을 직접 확인하는 짧은 코드
scores = [99,97,94,91,88,85,82,78,73,66,59,42]
correct = [1,1,0,1,1,1,0,1,0,1,0,1]
for threshold in [95,90,80,70,0]:
selected = [y for s,y in zip(scores,correct)
if s >= threshold]
n = len(selected)
errors = n - sum(selected)
coverage = n / len(scores)
risk = errors / n if n else None
print(threshold/100, n, errors,
coverage, risk, len(scores)-n)
표의 값은 위 Python 코드로 실제 검산했다. 점수를 정수로 적은 것은 0.90 같은 경계값의 비교를 단순하게 하기 위해서다. 실행 범위는 고정된 합성값의 선택·집계뿐이며, 모델 호출·임계값 학습·사람 검토 실험은 수행하지 않았다.
임계값 하나보다 먼저 남길 기록
“0.90 이상이면 자동 처리”라는 문장만 남기면 결정의 이유를 잃기 쉽다. 다음처럼 얼마를 자동 처리하고, 그 안에서 얼마나 틀리며, 얼마가 미완료로 넘어가는지를 함께 기록하자.
자료: 합성 12건 / 점수·정답 기준 고정 임계값: s ≥ 0.90 자동 선택: 4/12건 선택된 답의 오답: 1/4건 검토 경로로 넘긴 양: 8건 검토 완료·대기시간·최종 정답: 측정하지 않음 용도: 계산 설명 / 운영 기준 승인용 아님
이 기록에서 비어 있는 곳은 8건의 후속 처리다. 자동 답변의 오류율이 보기 좋아졌더라도 그 빈칸이 그대로라면, 전체 업무가 나아졌다고 말하기는 이르다.
자료와 확인 범위
- Geifman & El-Yaniv, Selective Classification for Deep Neural Networks, NIPS 2017: §2의 coverage·selective risk 정의와 §3–4의 선택 점수·임계값 구분. 논문 고유의 성능 보장을 이 예시에 적용하지 않았다.
- scikit-learn, Tuning the decision threshold for class prediction: 예측과 결정의 구분, 임계값 조정 시 자료 분리 주의사항.
자료 확인: 2026년 10월 11일. 본문 수치와 도식은 교육용 합성 12건이며 Python으로 산술만 검산했다. 문서 답변 서비스의 처리 경로와 기록 양식은 설계 제안이다. 실제 모델 성능, 사람의 검토 효과 또는 운영 임계값의 안전성을 입증하는 글이 아니다.