왜 그런가요
대기시간 평균이 커졌다는 보고를 보면 “대부분의 사람이 더 오래 기다렸구나”라고 생각하기 쉽습니다. 하지만 평균은 모든 값을 합쳐 만든 숫자입니다. 어느 값이 달라졌는지 보지 않고 많은 사람의 변화로 읽어도 될까요? 실제 병원 성과가 아닌 작은 가상 자료로 평균과 중앙값의 반응을 비교해 봅니다.
다섯 값 중 하나만 바꿔 보기
학습용 가상 대기시간은 5, 6, 7, 8, 34분입니다. 합계 60분을 관찰수 5로 나누면 평균은 12분입니다. 작은 순서로 정렬했을 때 가운데 세 번째 값인 중앙값은 7분입니다. 이제 앞의 네 값은 그대로 두고 마지막 값만 84분으로 바꿉니다.
| 자료 | 평균 | 중앙값 |
|---|---|---|
| 5·6·7·8·34분 | 60÷5 = 12분 | 7분 |
| 5·6·7·8·84분 | 110÷5 = 22분 | 7분 |
평균은 10분 늘었지만 다섯 값 중 네 값은 바뀌지 않았습니다. 이 예제에서는 “대부분의 대기가 길어졌다”가 계산에서 나오지 않습니다. 평균이 잘못 계산된 것이 아니라, 한 큰 값의 변화가 합계에 반영된 것입니다.
전체 합을 보는 값과 가운데 순서를 보는 값
호주 통계청은 평균을 모든 관찰값의 합을 관찰수로 나눈 값으로, 중앙값을 정렬한 자료의 가운데 값으로 설명합니다. 캐나다 통계청도 극단값에 중앙값이 평균보다 덜 민감하다는 점을 설명합니다. 위처럼 맨 끝 값만 바뀌면 가운데 순서는 그대로라 중앙값이 유지될 수 있습니다. 어떤 자료 변화에도 중앙값이 절대 변하지 않는다는 뜻은 아닙니다.
그렇다고 중앙값만 보면 충분한 것도 아닙니다. 두 줄에서 중앙값은 같지만 가장 오래 기다린 값은 다릅니다. 가운데 위치를 알면서도 값들이 얼마나 흩어져 있는지 놓칠 수 있습니다. 요약값을 함께 읽으면 “가운데는 같고 긴 대기 쪽이 달라졌다”처럼 더 구체적으로 말할 수 있습니다.
큰 값을 지우면 깔끔해지지 않을까?
호주 통계청은 유효한 극단값으로 확인됐다면 단지 평균에 영향을 준다는 이유로 자료에서 제거해서는 안 된다고 설명합니다. 입력 오류인지 실제 관찰인지 확인하는 일과 보기 좋은 평균을 만들려고 지우는 일은 다릅니다. 긴 대기가 실제 있었다면 그 경험도 보고에서 사라지면 안 됩니다.
마지막 연습은 숫자 하나를 해석하는 문장 고치기입니다. “평균이 늘어서 대부분의 대기도 늘었다” 대신 “가상 자료에서 한 긴 대기 값이 바뀌어 평균은 늘었고 중앙값은 같았다”라고 써 보세요. 합계·순서·자료의 퍼짐을 구분하면, 요약값의 변화가 누구의 어떤 변화인지 다시 묻게 됩니다.