오답·판단법
설문 응답을 1만 개 모았는데, 입력 프로그램이 ‘사용함’을 매번 ‘사용하지 않음’으로 바꾸어 저장했다고 생각해 보세요. 응답을 더 모으면 이 오류가 저절로 고쳐질까요? 자료 수가 줄일 수 있는 불확실성과, 처리 규칙을 바로잡아야 해결되는 오류는 다른 문제입니다.
자료 수보다 먼저 구별할 오류
| 상황 | 어떤 문제인가 | 확인할 것 |
|---|---|---|
| 확률표본을 다시 뽑으면 추정값이 달라짐 | 표본을 뽑는 과정의 변동 | 표집 설계와 표본오차 |
| 같은 응답을 매번 반대 범주로 저장 | 동일 방향으로 반복되는 처리오류 | 항목 정의와 코드 변환 규칙 |
| 새 자료도 잘못된 규칙으로 계속 저장 | 큰 자료에도 남는 체계적 오류 | 자료 수 증가가 아닌 규칙 교정과 재확인 |
표본오차와 비표본오차를 한 봉투에 넣지 않기
표본오차는 모집단 전체 대신 표본을 조사해서 생기는 추정의 변동과 관계됩니다. 적절한 표집 조건에서 표본을 늘리면 이를 줄일 수 있습니다. 반면 조사에는 누락, 응답 해석, 코딩과 입력 같은 비표본오차도 생길 수 있습니다. 그중 같은 방향으로 반복되는 오류는 표본을 늘렸다는 이유로 사라지지 않습니다.
캐나다 통계청의 조사 방법 부록은 비표본오차 중 무작위 성분과 체계적 성분을 구별하며, 체계적 오류가 만드는 편향을 표준오차가 반영하지 않는다고 설명합니다. 이 자료는 과거 조사에 관한 방법 설명이며, 당시 조사 결과를 한국 간호자료의 수치로 옮기는 것이 아닙니다.
미국 인구조사국의 방법 안내도 표본오차와 비표본오차를 나누고 코딩·처리 오류 등을 설명합니다. 비표본오차가 모든 경우에 같은 형태이거나 표본 수와 전혀 관계없다는 일반화는 피합니다. 이번 가상 문제의 조건은 ‘같은 잘못된 규칙이 반복된다’는 것입니다.
응답이 많은 것과 처리 규칙이 맞는 것
첫 문단의 예에서는 원래 응답, 항목의 의미, 저장 코드의 대응을 확인해야 합니다. 자료가 더 많다는 말만으로 그 대응이 맞았다는 증거를 만들 수 없습니다. 원자료 보존과 수정 경로는 실제 연구의 권한·절차에 따르고, 학생이 확인되지 않은 값을 임의로 바꾸는 연습은 하지 않습니다.
간호 연구표를 읽을 때 표본 수 옆에 ‘이 항목을 어떤 규칙으로 기록했나?’라는 질문을 남겨 보세요. 여기서 답은 큰 연구를 불신하라는 것이 아닙니다. 표본을 더 모으는 해결책과 잘못된 처리 규칙을 고치는 해결책을 맞는 문제에 연결하는 일입니다.