사례 한 장
간호연구 논문의 상자그림에 수염 끝은 30, 조금 떨어진 점은 40으로 보여요. “최댓값은 30”이라고 적어도 될까요? 먼저 그림 설명에서 수염을 그린 규칙을 읽어야 해요. 상자그림은 모양이 같아도 수염을 그리는 방식이 하나로 고정되어 있지는 않아요.
이번 그림은 1.5 IQR 규칙을 쓴다고 가정해요
사분위범위 IQR은 Q3에서 Q1을 뺀 값이므로 10이에요. 위쪽 계산 경계는 Q3 + 1.5×IQR, 즉 20+15=35예요. 하지만 수염이 새로운 관측값 35를 만들어 그곳에서 끝나는 것은 아니에요. 이 규칙에서는 경계 안의 가장 큰 관측값까지 이어져요. 그래서 가상 예시의 수염 끝은 30이에요.
세 숫자에 서로 다른 이름을 붙여요
- 35 · 계산 경계: 사분위수와 IQR로 구한 기준이에요. 자료에서 실제로 관찰된 값이라고 가정하지는 않아요.
- 30 · 수염 끝: 이 가상 자료에서 경계 안의 가장 큰 관측값이에요. 전체 최댓값과는 달라요.
- 40 · 별도로 표시된 관측값: 위쪽 수염을 넘는 값이에요. 따로 점으로 보인다고 입력 오류나 삭제할 자료로 판단하지는 않아요.
수염 규칙은 범례부터 확인해요
NIST는 최소·최대까지 잇는 상자그림과 사분위범위 경계를 쓰는 변형을 따로 설명해요. R의 boxplot.stats 문서도 양의 계수에서는 경계 안 최외곽 관측값까지, 계수가 0이면 전체 극값까지 수염을 잇는다고 구별해요. 수염이 언제나 최댓값이라는 암기도, 언제나 1.5 IQR이라는 반대 암기도 맞지 않아요.
상자 경계의 계산법도 프로그램마다 확인해야 해요. R 문서는 hinges가 사분위수와 항상 정확히 같지는 않다고 설명해요. 이번 예시에서는 Q1·Q3가 주어졌다고 가정했어요. 어떤 자료의 사분위수 계산법을 새로 정하는 문제는 아니에요.
규칙과 관측값을 함께 옮겨 적어요
“최댓값 30” 대신 “1.5 IQR 규칙에서 위 수염 끝은 30, 별도 관측점은 40”이라고 적으면 규칙과 실제 값이 함께 남아요. 40이 왜 멀리 있는지, 오류인지 실제 관찰인지는 원자료와 연구 방법에서 확인할 질문이에요. 작은 그림만 보고 관측값을 삭제하거나 집단 차이의 유의성까지 결론 내리지는 않아요.
참고 자료 · 확인일 2026.10.04: National Institute of Standards and Technology · Engineering Statistics Handbook — 1.3.3.7 Box Plot · R Core Team / R Project · R Documentation — boxplot.stats {grDevices} · National Institute of Standards and Technology · Engineering Statistics Handbook — 7.1.6 What are outliers in the data?