확률표본추출과 비확률표본추출, 누굴 뽑느냐가 결과를 바꾼다

한 대학이 재학생 만족도를 조사한다고 하자. 조사팀은 학교 홈페이지와 SNS에 설문 링크를 게시했고, 자발적으로 참여한 학생 1,000명 가운데 82%가 학교생활에 만족한다고 응답했다.

다른 조사팀은 전체 재학생 명부에서 500명을 무작위로 선정해 같은 질문을 물었다. 여러 차례 연락한 끝에 얻은 만족도는 64%였다.

첫 번째 조사는 1,000명, 두 번째 조사는 500명을 조사했다. 표본크기만 보면 첫 번째 조사가 더 믿을 만해 보인다. 그러나 첫 번째 조사에는 학교에 관심이 많거나 만족도가 높은 학생이 적극적으로 참여했을 가능성이 있다. 반대로 학교생활에 무관심하거나 홈페이지를 거의 방문하지 않는 학생은 조사 자체를 알지 못했을 수 있다.

표본이 많다는 사실과 모집단을 잘 대표한다는 사실은 같지 않다.

통계조사는 모집단 전체를 직접 조사하지 않고 일부를 관찰해 전체의 특성을 추정한다. 이 과정에서 가장 먼저 결정해야 하는 것이 누구를, 어떤 방식으로 표본에 포함할 것인가이다.

표본추출은 크게 확률표본추출과 비확률표본추출로 나눌 수 있다. 두 방식의 차이는 단순히 무작위 추출을 했는지 여부에 그치지 않는다. 표본이 선택될 확률을 알고 있는지, 표본오차를 설계에 근거해 계산할 수 있는지, 결과를 어떤 모집단까지 일반화할 수 있는지가 달라진다.

누구를 뽑았는지는 결국 무엇을 말할 수 있는지를 결정한다.

표본추출 전에 모집단부터 정의해야 한다

표본추출 방법을 선택하기 전에 연구자가 추론하려는 모집단을 명확하게 정의해야 한다.

“대학생의 스마트폰 사용시간을 조사한다”는 문장만으로는 모집단이 충분히 구체적이지 않다.

  • 대한민국의 모든 대학생인가?
  • 특정 지역의 대학생인가?
  • 4년제 대학 재학생만 포함하는가?
  • 휴학생과 대학원생도 포함하는가?
  • 조사 시점은 언제인가?

모집단이 명확하지 않으면 표본이 모집단을 대표하는지 판단할 수도 없다.

목표모집단과 조사모집단은 다를 수 있다

목표모집단은 연구자가 궁극적으로 결과를 적용하려는 전체 집단이다.

조사모집단은 실제 조사과정에서 접근할 수 있는 집단이다.

예를 들어 전국 대학생의 생활실태를 조사하려 하지만 조사팀이 확보한 명부가 수도권 10개 대학 재학생 명단뿐이라면 목표모집단과 조사모집단이 다르다.

수도권 10개 대학에서 아무리 정교하게 무작위표본을 뽑더라도, 그 결과가 전국의 모든 대학생을 자동으로 대표하지는 않는다.

표본틀은 실제 추출에 사용하는 목록이다

표본틀은 표본을 추출할 때 사용하는 명단이나 자료체계다.

대표적인 표본틀은 다음과 같다.

  • 주민등록 명부
  • 학생 명부
  • 사업체 목록
  • 전화번호 목록
  • 주소 데이터베이스
  • 회원 데이터베이스
  • 학교와 학급 목록

표본틀에 목표모집단의 일부가 누락되면 포함오차 또는 포괄오차가 발생한다.

온라인 쇼핑몰 고객조사에서 회원목록만 사용하면 비회원 구매자는 표본에 포함될 수 없다. 유선전화 목록을 사용한 조사에서는 유선전화가 없는 가구가 제외될 수 있다.

확률표본추출을 했더라도 표본틀이 모집단을 충분히 포함하지 못하면 결과는 편향될 수 있다(Groves et al., 2009).

추출단위와 관찰단위를 구분해야 한다

표본으로 직접 선택하는 단위와 실제로 정보를 수집하는 단위가 다를 수 있다.

전국 초등학생의 수면시간을 조사한다고 하자.

  1. 먼저 학교를 뽑는다.
  2. 선택된 학교에서 학급을 뽑는다.
  3. 선택된 학급의 학생을 조사한다.

이때 학교와 학급은 추출과정의 표본단위이고, 학생은 최종 관찰단위다.

개념의미학교조사의 예
목표모집단결과를 적용하려는 전체 집단전국 초등학생
표본틀표본추출에 사용하는 목록전국 학교와 학급 목록
1차 추출단위첫 단계에서 선택하는 단위학교
2차 추출단위다음 단계에서 선택하는 단위학급
관찰단위실제 정보를 측정하는 대상학생
분석단위통계적 결론을 내리는 단위학생 또는 학교

이 구분이 불명확하면 표본설계뿐 아니라 표준오차 계산도 잘못될 수 있다.

확률표본추출은 선택확률을 알고 있는 설계다

확률표본추출은 목표모집단의 각 구성원이 표본에 포함될 확률이 표본설계에 의해 알려져 있고, 그 확률이 0보다 큰 추출방식이다(Särndal et al., 1992).

모집단 구성원 \(i\)가 표본에 포함될 확률을 다음과 같이 나타낼 수 있다.

\[
\pi_i>0
\]

여기서 \(\pi_i\)는 구성원 \(i\)의 포함확률이다.

확률표본추출을 “모든 사람이 동일한 확률로 뽑히는 방식”이라고 설명하는 경우가 많다. 그러나 이는 정확하지 않다.

모든 구성원의 포함확률이 반드시 같을 필요는 없다. 중요한 조건은 포함확률이 표본설계에 의해 알려져 있으며 0이 아니라는 것이다.

소규모 지역이나 희귀집단을 더 많이 추출하기 위해 일부 구성원에게 더 높은 선택확률을 부여할 수도 있다. 규모가 큰 학교나 사업체가 더 높은 확률로 선택되는 비례확률추출도 확률표본추출에 해당한다.

확률표본에서는 설계가 추론의 근거가 된다

확률표본의 중요한 장점은 표본이 선택된 확률을 이용해 모집단의 특성과 표본오차를 추정할 수 있다는 점이다.

각 관측값에 부여하는 기본 설계가중치는 일반적으로 포함확률의 역수다.

\[
w_i=\frac{1}{\pi_i}
\]

어떤 학생의 포함확률이 100분의 1이라면 기본 가중치는 100이다. 이 학생 한 명이 모집단의 약 100명을 대표한다는 의미로 해석할 수 있다.

확률표본추출이 자동으로 정확한 결과를 보장하는 것은 아니다. 하지만 표본설계에 근거해 모집단 추론과 표본오차 계산을 수행할 수 있다는 점에서 중요한 방법론적 기반을 제공한다.

단순무작위추출은 모든 표본조합에 무작위성을 부여한다

단순무작위추출은 모집단에서 정해진 수의 구성원을 무작위로 선택하는 방법이다.

모집단의 크기가 \(N\), 추출할 표본의 크기가 \(n\)이라면 각 구성원의 포함확률은 다음과 같다.

\[
\pi_i=\frac{n}{N}
\]

재학생 5,000명 중 300명을 단순무작위로 추출한다면 각 학생의 포함확률은 다음과 같다.

\[
\pi_i=\frac{300}{5000}=0.06
\]

각 학생은 6%의 확률로 표본에 포함된다.

단순무작위추출의 장점

단순무작위추출은 구조가 명확하고 분석이 비교적 쉽다. 특정 집단을 의도적으로 더 많이 또는 적게 뽑지 않으므로 표본설계에 대한 설명도 간단하다.

모집단 명부가 정확하고 모든 대상자에게 접근할 수 있다면 효과적인 방법이다.

단순무작위추출의 한계

모집단 전체의 명단이 필요하다. 전국 가구나 전체 소비자의 완전한 명단을 확보하는 것은 현실적으로 어려울 수 있다.

대상자가 전국에 넓게 흩어져 있으면 조사비용도 증가한다. 또한 모집단 내 소수집단의 규모가 매우 작으면 무작위추출 과정에서 해당 집단이 충분히 포함되지 않을 수 있다.

단순무작위라는 말이 단순한 실행을 의미하지는 않는다.

층화표본추출은 중요한 집단을 나누어 뽑는다

층화표본추출은 모집단을 서로 겹치지 않는 여러 층으로 나눈 뒤 각 층에서 확률표본을 추출하는 방법이다.

층을 나누는 기준으로는 다음과 같은 변수를 사용할 수 있다.

  • 성별
  • 연령대
  • 지역
  • 학교 유형
  • 기업 규모
  • 고객등급
  • 산업분류

전국 대학생을 수도권과 비수도권으로 나누고 각 지역에서 학생을 무작위로 추출하면 지역을 기준으로 한 층화표본추출이다.

비례층화추출

각 층의 모집단 크기에 비례해 표본을 배분할 수 있다.

전체 표본크기를 \(n\), 층 \(h\)의 모집단 크기를 \(N_h\), 전체 모집단 크기를 \(N\)이라고 하면 비례배분 표본크기는 다음과 같다.

\[
n_h=n\frac{N_h}{N}
\]

전체 학생의 70%가 수도권에 있고 표본 1,000명을 추출한다면 수도권에서 약 700명, 비수도권에서 약 300명을 추출한다.

불비례층화추출

특정 집단을 더 자세히 분석하기 위해 모집단 비율보다 많이 추출할 수도 있다.

전체 학생의 5%에 불과한 장애학생의 경험을 분석하려면 장애학생을 의도적으로 더 많이 추출하는 것이 유용할 수 있다.

이는 표본설계상의 오류가 아니다. 알려진 포함확률을 이용해 가중치를 적용하면 전체 모집단 추정치를 계산할 수 있다.

층화추출이 유용한 이유

각 층 안의 구성원이 비교적 비슷하고 층 간 차이가 크다면 층화는 추정의 정밀도를 높일 수 있다.

또한 모집단에서 비중이 작은 집단도 표본에 충분히 포함할 수 있다. 다만 층을 나누었다는 사실만으로 대표성이 자동으로 확보되는 것은 아니다. 각 층 안에서도 확률적으로 표본을 추출해야 한다.

군집표본추출은 개인보다 집단을 먼저 뽑는다

군집표본추출은 모집단을 학교, 학급, 지역, 병원이나 사업장 같은 군집으로 나눈 뒤 일부 군집을 선택하는 방식이다.

전국 초등학생을 조사하기 위해 20개 학교를 무작위로 선택한 다음, 선택된 학교의 학생을 조사하는 경우가 대표적이다.

군집표본추출의 장점

개인을 전국에서 직접 뽑으면 이동거리와 조사비용이 커진다. 학교나 지역을 먼저 선택하면 조사대상을 지리적으로 집중할 수 있어 비용을 줄일 수 있다.

전국 단위 가구조사에서는 조사구, 가구와 가구원을 순차적으로 추출하는 다단계 군집표본설계가 자주 사용된다.

군집표본추출의 통계적 비용

같은 학교 학생들은 서로 비슷한 교육환경을 공유한다. 같은 지역 주민들도 주거환경과 생활조건이 비슷할 수 있다.

군집 안의 구성원이 서로 비슷하면 서로 다른 군집에서 뽑은 독립적인 구성원보다 새로운 정보를 적게 제공한다.

평균 군집크기를 \(m\), 군집 내 상관을 \(\rho\)라고 할 때 단순한 조건에서 설계효과는 다음과 같이 근사할 수 있다.

\[
DEFF=1+(m-1)\rho
\]

예를 들어 한 군집에서 평균 20명을 조사하고 군집 내 상관이 0.05라면 다음과 같다.

\[
DEFF=1+(20-1)\times0.05=1.95
\]

같은 표본크기의 단순무작위표본과 비교할 때 분산이 약 1.95배가 될 수 있다는 의미다.

따라서 군집표본을 단순무작위표본처럼 분석하면 표준오차를 과소평가할 수 있다. 군집, 층과 가중치를 반영한 복합표본 분석이 필요하다(Lumley, 2010).

계통표본추출은 일정한 간격으로 대상을 선택한다

계통표본추출은 정렬된 모집단 목록에서 무작위로 시작점을 정한 뒤 일정한 간격으로 대상을 선택하는 방법이다.

모집단 크기가 \(N\), 표본크기가 \(n\)일 때 추출간격은 다음과 같다.

\[
k=\frac{N}{n}
\]

1,000명의 목록에서 100명을 뽑는다면 추출간격은 10이다.

1부터 10 사이에서 시작점을 무작위로 하나 선택한다. 시작점이 7이라면 다음과 같이 추출한다.

7, 17, 27, 37, 47, ...

계통표본추출의 장점

단순무작위추출보다 실행이 간단하고 표본이 목록 전체에 고르게 분포한다.

생산라인의 제품검사, 출입명부와 고객목록에서 표본을 추출할 때 유용하다.

주기성이 있으면 왜곡될 수 있다

목록에 추출간격과 일치하는 반복적 패턴이 존재하면 특정 유형만 반복해서 선택될 수 있다.

예를 들어 직원목록이 부서별로 일정한 패턴을 가지고 있고 추출간격이 그 패턴과 일치하면 일부 직급이나 근무형태가 과도하게 포함될 수 있다.

계통추출에서는 목록이 어떤 순서로 배열되어 있는지 반드시 확인해야 한다.

비례확률추출과 다단계추출도 자주 사용된다

학교 규모가 서로 크게 다르다고 하자. 학생 수가 100명인 학교와 2,000명인 학교를 같은 확률로 선택하면 학생 개인의 최종 포함확률이 달라질 수 있다.

이때 학교의 학생 수에 비례해 학교를 선택하는 비례확률추출을 사용할 수 있다.

학교 \(i\)의 규모를 \(M_i\)라고 하면 선택확률은 다음과 같은 관계를 가질 수 있다.

\[
\pi_i\propto M_i
\]

규모가 큰 학교는 더 높은 확률로 선택된다.

실제 국가통계조사는 하나의 추출방법만 사용하기보다 여러 방법을 결합한다.

예를 들면 다음과 같다.

  1. 지역별로 층을 나눈다.
  2. 각 층에서 조사구를 규모에 비례해 추출한다.
  3. 선택된 조사구에서 가구를 계통추출한다.
  4. 선택된 가구에서 개인을 추출한다.

이러한 복합표본설계는 비용과 대표성을 함께 고려하기 위한 현실적인 방법이다(Brick, 2011).

비확률표본추출은 선택확률을 알 수 없는 방식이다

비확률표본추출에서는 모집단 구성원의 포함확률이 표본설계에 의해 알려져 있지 않다.

일부 구성원은 조사에 참여할 가능성이 매우 높고, 일부는 사실상 참여할 기회가 없을 수 있다. 그러나 각 사람의 선택확률을 정확하게 계산하기 어렵다.

비확률표본이 곧 부실한 조사라는 뜻은 아니다. 탐색적 연구, 질적 연구, 초기 제품개발과 접근하기 어려운 집단의 조사에서는 중요한 역할을 한다.

다만 비확률표본에서 얻은 결과를 모집단 전체로 일반화하려면 확률표본보다 더 강한 모형과 가정이 필요하다(Baker et al., 2013; Elliott & Valliant, 2017).

편의표본추출은 접근하기 쉬운 대상을 조사한다

편의표본추출은 연구자가 쉽게 접근할 수 있는 사람을 대상으로 표본을 구성하는 방법이다.

대표적인 사례는 다음과 같다.

  • 자신의 강의를 듣는 학생에게 설문하기
  • 길거리에서 지나가는 사람을 인터뷰하기
  • 특정 병원을 방문한 환자만 조사하기
  • 회사 내부 게시판에 설문 링크 올리기
  • 연구자의 지인에게 설문 요청하기

비용이 적고 빠르게 자료를 수집할 수 있다는 장점이 있다. 연구도구를 사전검사하거나 새로운 현상을 탐색하는 데 유용할 수 있다.

그러나 접근하기 쉬운 사람이 모집단의 전형적인 구성원이라는 보장은 없다.

교수가 자신의 수업 학생을 조사했다면 그 결과는 우선 해당 수업 참여자의 특성을 설명한다. 이를 전국 대학생 전체의 특성으로 확대하려면 별도의 근거가 필요하다.

자발적 참여표본은 참여의지가 결과와 연결될 수 있다

홈페이지, SNS나 이메일에 설문 링크를 공개하고 원하는 사람이 참여하게 하는 방법은 자발적 참여표본 또는 자기선택표본이다.

온라인 조사에서 흔히 사용되지만 다음과 같은 사람이 더 적극적으로 참여할 수 있다.

  • 주제에 관심이 많은 사람
  • 매우 긍정적이거나 부정적인 경험이 있는 사람
  • 인터넷 사용빈도가 높은 사람
  • 시간적 여유가 있는 사람
  • 보상에 민감한 사람

조사 참여의지가 조사하려는 결과와 관련되어 있으면 자기선택편향이 발생한다.

웹조사는 빠르고 저렴하지만 인터넷 접근성, 패널 가입과 응답의지가 조사결과와 관련될 수 있다(Couper, 2000; Bethlehem, 2010).

다만 모든 온라인 조사가 비확률표본인 것은 아니다. 확률적으로 모집한 패널 구성원에게 온라인으로 설문을 실시한다면 자료수집 방식은 온라인이지만 표본모집은 확률적일 수 있다.

온라인 조사인지 여부와 확률표본인지 여부는 별개의 문제다.

할당표본추출은 층화추출과 비슷해 보여도 다르다

할당표본추출은 모집단의 성별, 연령이나 지역 비율에 맞추어 정해진 수의 응답자를 확보하는 방법이다.

예를 들어 표본 1,000명을 다음과 같이 구성할 수 있다.

  • 남성 500명
  • 여성 500명
  • 20대 200명
  • 30대 250명
  • 40대 250명
  • 50대 이상 300명

표면적으로는 층화표본추출과 비슷해 보인다. 하지만 중요한 차이가 있다.

구분층화표본추출할당표본추출
집단 구분모집단을 층으로 구분모집단을 할당범주로 구분
범주 안 선택확률적으로 선택편의적 또는 판단적으로 선택 가능
포함확률알려져 있음일반적으로 알 수 없음
표본오차설계에 따라 추정 가능설계만으로 계산하기 어려움
모집단 추론설계기반 추론 가능추가 가정이 필요

성별과 연령 비율을 모집단과 동일하게 맞추었다고 해서 표본이 모든 특성에서 대표적이라는 뜻은 아니다.

같은 20대 여성 범주 안에서도 정치관심도가 높거나 특정 플랫폼을 자주 이용하는 사람만 참여할 수 있다. 알려진 인구통계 비율을 맞추어도 관찰하지 못한 특성의 선택편향은 남을 수 있다.

판단표본추출은 연구목적에 맞는 대상을 선택한다

판단표본추출 또는 목적표본추출은 연구자가 연구목적에 적합하다고 판단한 대상을 의도적으로 선택하는 방법이다.

다음과 같은 연구에서 유용하다.

  • 전문가 인터뷰
  • 특정 경험을 가진 소비자 조사
  • 희귀사건 사례연구
  • 정책담당자 심층면접
  • 신제품 선도사용자 조사
  • 질적 연구의 핵심정보제공자 선정

신제품 개발 초기 단계에서 IT 기기에 관심이 많은 소비자를 심층인터뷰하는 것은 합리적일 수 있다. 연구목적이 전체 소비자의 구매율을 추정하는 것이 아니라 사용경험과 개선 아이디어를 탐색하는 것이기 때문이다.

문제는 목적표본의 결과를 전체 소비자의 비율이나 평균처럼 표현할 때 발생한다.

목적표본에서는 누구를 포함했고 왜 그들을 선택했는지, 결과를 어느 범위까지 해석할 것인지를 명확하게 밝혀야 한다.

눈덩이표본추출은 관계망을 통해 참여자를 찾는다

눈덩이표본추출은 초기 참여자가 새로운 참여자를 소개하면서 표본을 확대하는 방법이다.

공식적인 명단이 없거나 일반적인 방식으로 접근하기 어려운 집단에서 활용된다.

  • 미등록 이주민
  • 불법약물 사용자
  • 희귀질환자
  • 특정 직업 네트워크
  • 낙인과 차별을 경험하는 집단

눈덩이표본은 신뢰관계를 활용해 접근하기 어려운 사람을 만날 수 있다는 장점이 있다.

그러나 참여자의 지인관계에 의존하므로 네트워크가 큰 사람이나 같은 특성을 공유하는 사람이 과도하게 포함될 수 있다.

응답자주도표본추출과 단순 눈덩이추출은 다르다

응답자주도표본추출은 제한된 수의 추천권, 여러 모집단계와 참여자의 네트워크 크기 정보를 이용해 눈덩이표본의 한계를 줄이려는 방법이다(Salganik & Heckathorn, 2004).

하지만 응답자주도표본추출도 다음과 같은 강한 가정을 필요로 한다.

  • 모집 네트워크가 충분히 연결되어 있다.
  • 참여자가 지인의 네트워크 크기를 정확하게 보고한다.
  • 모집관계와 조사변수의 연관성이 적절히 다뤄진다.
  • 초기 참여자의 영향이 여러 모집단계를 거치며 줄어든다.

응답자주도표본추출이라는 이름을 사용했다고 해서 자동으로 확률표본과 같은 성질을 얻는 것은 아니다.

확률표본이라고 항상 대표적인 것은 아니다

확률표본추출은 모집단 추론을 위한 강한 기반을 제공하지만 조사품질을 자동으로 보장하지 않는다.

조사결과에는 표본추출 외에도 여러 종류의 오류가 영향을 준다.

포함오차

표본틀에 목표모집단의 일부가 누락되거나 목표모집단이 아닌 대상이 포함되는 문제다.

대학생 조사에서 재학생 명부에 휴학처리 정보가 늦게 반영되거나, 해외체류 학생의 연락처가 누락될 수 있다.

비응답오차

표본으로 선택된 사람이 조사에 응답하지 않는 문제다.

응답하지 않은 사람과 응답한 사람이 조사변수에서 체계적으로 다르면 비응답편향이 발생한다.

응답률이 낮다고 반드시 편향이 큰 것은 아니며, 응답률이 높다고 편향이 없는 것도 아니다. 중요한 것은 응답여부가 조사하려는 변수와 얼마나 관련되어 있는가이다(Groves & Peytcheva, 2008).

측정오차

질문의 표현, 응답자의 기억, 사회적 바람직성, 조사방식과 조사원의 태도 때문에 실제 값과 응답이 달라질 수 있다.

표본을 완벽하게 추출했더라도 질문이 모호하면 결과는 정확하지 않다.

처리오차

코딩, 데이터 입력, 결측처리, 가중치 계산과 분석 과정에서도 오류가 발생할 수 있다.

Groves 등(2009)의 총조사오차 관점은 조사품질을 표본오차 하나로 평가해서는 안 된다는 점을 강조한다.

표본이 커져도 선택편향은 사라지지 않는다

표본크기가 커지면 무작위 표본오차는 일반적으로 감소한다. 그러나 표본선택 과정에서 발생한 체계적 편향은 표본크기만 늘린다고 해결되지 않는다.

어떤 정치성향의 이용자가 많은 온라인 플랫폼에서 100만 명을 조사했다고 하자. 응답자가 매우 많더라도 플랫폼을 사용하지 않는 사람이나 성향이 다른 사람은 충분히 포함되지 않을 수 있다.

반면 적절한 표본틀에서 2,000명을 확률적으로 추출한 조사는 표본크기가 더 작아도 목표모집단을 추론하는 데 더 적합할 수 있다.

Meng(2018)은 큰 자료가 선택편향과 결합하면 매우 작은 표준오차를 가지면서도 실제 값에서는 크게 벗어나는 ‘빅데이터 역설’이 나타날 수 있음을 설명했다.

표본크기가 크면 잘못된 값을 더 정밀하게 추정하는 상황도 발생할 수 있다.

정밀성과 정확성은 다르다

정밀성은 반복해서 표본을 추출했을 때 추정값이 얼마나 좁게 모이는지를 말한다.

정확성은 추정값이 실제 모집단 값에 얼마나 가까운지를 말한다.

편향된 표본을 매우 크게 수집하면 추정값은 매번 비슷하게 나올 수 있다. 즉, 정밀하지만 정확하지 않을 수 있다.

큰 표본은 나쁜 표본설계를 대신하지 못한다.

가중치는 불균등한 선택확률을 보정한다

확률표본에서 각 구성원의 포함확률이 다르면 설계가중치를 사용한다.

기본 설계가중치는 다음과 같다.

\[
w_i=\frac{1}{\pi_i}
\]

가중평균은 다음과 같이 계산할 수 있다.

\[
\bar{y}w=
\frac{\sum
{i=1}^{n}w_i y_i}
{\sum_{i=1}^{n}w_i}
\]

여기서 \(y_i\)는 조사값이고 \(w_i\)는 가중치다.

가중치에는 여러 조정이 포함될 수 있다

실제 조사에서는 기본 설계가중치에 다음 조정을 추가할 수 있다.

  • 비응답 조정
  • 사후층화
  • 레이킹
  • 모집단 보조정보를 이용한 보정
  • 극단가중치 절단

예를 들어 표본의 연령분포가 모집단과 다르면 알려진 모집단 연령분포에 맞도록 가중치를 조정할 수 있다.

가중치가 모든 편향을 제거하지는 않는다

가중치는 관찰되고 보정에 사용된 변수에 대해서는 표본과 모집단의 차이를 줄일 수 있다.

그러나 조사 참여에 영향을 주면서 결과와도 관련된 변수가 측정되지 않았다면 편향이 남을 수 있다.

온라인 자발적 표본을 성별과 연령에 맞추었다고 해도 정치관심도, 디지털 접근성이나 조사주제에 대한 관심이 선택과 결과에 영향을 준다면 완전한 보정은 어렵다.

비확률표본의 가중조정은 유용할 수 있지만 성공 여부는 선택과정을 설명하는 보조변수가 충분한지에 의존한다(Mercer et al., 2017; Elliott & Valliant, 2017).

표본오차는 조사의 모든 오류를 의미하지 않는다

여론조사에서 다음과 같은 표현을 자주 볼 수 있다.

95% 신뢰수준에서 표본오차는 ±3.1%포인트다.

단순무작위표본에서 비율의 표준오차는 다음과 같이 근사할 수 있다.

\[
SE(\hat{p})=
\sqrt{
\frac{\hat{p}(1-\hat{p})}{n}
}
\]

95% 오차한계는 대략 다음과 같다.

\[
MOE\approx1.96\times SE(\hat{p})
\]

표본크기가 1,000명이고 비율을 0.5로 가정하면 약 3.1%포인트의 오차한계가 나온다.

하지만 이 값은 다음 문제를 포함하지 않는다.

  • 표본틀에서 누락된 사람
  • 응답하지 않은 사람과 응답자의 차이
  • 질문 문구의 영향
  • 조사방식의 차이
  • 허위응답과 기억오류
  • 가중치와 복합표본설계의 영향
  • 데이터 처리오류

또한 군집표본이나 불균등 가중치를 사용하면 단순무작위표본 공식보다 표준오차가 커질 수 있다.

비확률표본에서 단순무작위표본 공식을 적용해 ±3.1%포인트라고 표시하는 것도 정당화되기 어렵다. 선택확률을 알 수 없기 때문에 표본설계에 근거한 표본오차가 아니기 때문이다(Baker et al., 2013).

층화와 군집은 목적이 다르다

층화표본추출과 군집표본추출은 모두 모집단을 집단으로 나눈다는 점에서 혼동하기 쉽다.

그러나 표본을 뽑는 방식과 목적이 다르다.

구분층화표본추출군집표본추출
표본선정모든 층에서 표본을 추출일부 군집만 선택
주된 목적정밀도 향상과 하위집단 확보조사비용과 이동거리 절감
바람직한 구조층 내부가 비교적 동질적선택된 군집이 모집단을 폭넓게 포함
대표 사례성별·연령별 추출학교·지역·학급 추출
분석 시 주의층과 가중치 반영군집 내 상관 반영

층화표본은 중요한 집단이 모두 표본에 포함되도록 설계한다. 군집표본은 일부 집단을 먼저 선택해 조사비용을 줄인다.

두 방법은 함께 사용할 수도 있다. 지역별로 층을 나눈 뒤 각 층에서 학교를 군집으로 추출하는 방식이다.

연구목적에 따라 표본추출 방법은 달라진다

어떤 표본추출 방법이 항상 가장 좋다고 말할 수는 없다.

연구목적고려할 수 있는 방법해석 시 주의점
국민의 지지율 추정확률표본, 복합표본포함오차와 비응답 조정
대학생 만족도 추정학생명부 기반 확률표본휴학생·비응답자 처리
희귀집단의 경험 탐색목적표본, 눈덩이표본모집단 비율로 일반화 제한
신제품 아이디어 발굴목적표본, 선도사용자 인터뷰탐색적 결과로 해석
웹사이트 A/B 실험무작위 배정실험 참여자 밖으로의 일반화
초기 설문문항 점검편의표본측정도구 점검에 한정
전국 건강지표 산출층화·군집·다단계 확률표본설계가중치와 복합표본 분석

전체 모집단의 평균, 비율이나 총계를 추정하려면 일반적으로 확률표본이 가장 직접적인 설계근거를 제공한다.

비확률표본도 모집단 추론에 사용할 수 있지만 선택과정을 설명하는 충분한 보조정보와 통계모형이 필요하다. 이 경우 결론은 표본설계뿐 아니라 모형의 타당성에 더 크게 의존한다.

R로 확률표본과 비확률표본의 차이 확인하기

가상의 대학생 모집단 10,000명을 만들어 표본추출 방법에 따라 결과가 어떻게 달라지는지 살펴보자.

set.seed(2026)

N <- 10000

population <- data.frame(
  id = seq_len(N),
  region = sample(
    c("수도권", "비수도권"),
    size = N,
    replace = TRUE,
    prob = c(0.70, 0.30)
  ),
  age_group = sample(
    c("20대", "30대", "40대 이상"),
    size = N,
    replace = TRUE,
    prob = c(0.30, 0.35, 0.35)
  )
)

population$satisfaction <-
  3.2 +
  ifelse(
    population$region == "수도권",
    0.25,
    -0.25
  ) +
  ifelse(
    population$age_group == "20대",
    0.20,
    0
  ) +
  rnorm(N, mean = 0, sd = 0.75)

population$satisfaction <- pmin(
  5,
  pmax(1, population$satisfaction)
)

mean(population$satisfaction)
R

이 값은 가상 모집단의 실제 평균 만족도다.

단순무작위표본 추출하기

set.seed(2026)

n <- 500

srs_index <- sample(
  seq_len(N),
  size = n,
  replace = FALSE
)

srs <- population[srs_index, ]

c(
  population_mean =
    mean(population$satisfaction),
  srs_mean =
    mean(srs$satisfaction)
)
R

단순무작위표본의 평균은 표본추출에 따라 모집단 평균 주변에서 달라진다.

다른 난수 시드를 사용해 반복하면 매번 조금 다른 평균이 나오며, 이 변동이 표본오차와 연결된다.

계통표본추출 실행하기

가상 모집단의 크기는 10,000명이고 표본크기는 500명이므로 추출간격은 20이다.

set.seed(2026)

k <- N / n

random_start <- sample(
  seq_len(k),
  size = 1
)

systematic_index <- seq(
  from = random_start,
  by = k,
  length.out = n
)

systematic_sample <-
  population[systematic_index, ]

mean(systematic_sample$satisfaction)
R

이 사례에서는 (N)이 (n)으로 정확히 나누어지므로 일정한 간격을 사용할 수 있다.

실제 자료에서는 목록의 정렬순서와 주기성을 먼저 확인해야 한다.

불비례층화표본과 가중치 적용하기

수도권과 비수도권에서 각각 250명씩 추출해 보자.

모집단에서는 수도권이 약 70%, 비수도권이 약 30%이므로 표본에서 비수도권 학생을 과대표집하는 설계다.

set.seed(2026)

capital_index <- which(
  population$region == "수도권"
)

noncapital_index <- which(
  population$region == "비수도권"
)

stratified_index <- c(
  sample(
    capital_index,
    size = 250,
    replace = FALSE
  ),
  sample(
    noncapital_index,
    size = 250,
    replace = FALSE
  )
)

stratified_sample <-
  population[stratified_index, ]

prop.table(
  table(population$region)
)

prop.table(
  table(stratified_sample$region)
)
R

표본에서는 두 지역이 각각 50%이므로 단순평균을 계산하면 모집단의 지역구성을 반영하지 못한다.

각 지역의 포함확률을 반영한 가중치를 계산한다.

stratified_sample$weight <- ifelse(
  stratified_sample$region == "수도권",
  length(capital_index) / 250,
  length(noncapital_index) / 250
)

unweighted_mean <-
  mean(stratified_sample$satisfaction)

weighted_mean <- weighted.mean(
  x = stratified_sample$satisfaction,
  w = stratified_sample$weight
)

c(
  population_mean =
    mean(population$satisfaction),
  unweighted_mean =
    unweighted_mean,
  weighted_mean =
    weighted_mean
)
R

불비례층화표본에서는 가중평균이 모집단 구조를 반영한다.

가중치를 사용하지 않은 평균은 수도권과 비수도권을 동일한 비중으로 취급하므로 전체 모집단 평균과 다른 값을 나타낼 수 있다.

자기선택이 있는 온라인 패널 만들기

이번에는 20대이거나 만족도가 높은 학생일수록 온라인 패널에 가입할 가능성이 높다고 가정해 보자.

join_probability <- plogis(
  -0.5 +
  0.9 * (
    population$age_group == "20대"
  ) +
  0.6 * (
    population$satisfaction - 3
  )
)

population$panel_member <- rbinom(
  n = N,
  size = 1,
  prob = join_probability
)

online_panel <- population[
  population$panel_member == 1,
]
R

온라인 패널 안에서 500명을 무작위로 뽑는다.

set.seed(2026)

panel_index <- sample(
  seq_len(nrow(online_panel)),
  size = 500,
  replace = FALSE
)

nonprobability_sample <-
  online_panel[panel_index, ]

c(
  population_mean =
    mean(population$satisfaction),
  nonprobability_mean =
    mean(
      nonprobability_sample$satisfaction
    )
)
R

온라인 패널 안에서는 무작위로 500명을 뽑았지만, 패널 가입 자체가 자기선택에 의해 이루어졌다.

따라서 전체 대학생 모집단을 기준으로 보면 비확률표본이다.

패널 내부의 무작위추출이 패널 밖의 학생이 제외된 문제를 해결하지는 않는다.

복합표본의 표준오차 계산하기

가중치와 층을 반영한 표준오차는 survey 패키지로 계산할 수 있다.

# 최초 한 번만 실행
# install.packages("survey")

library(survey)

stratified_design <- svydesign(
  ids = ~1,
  strata = ~region,
  weights = ~weight,
  data = stratified_sample
)

svymean(
  ~satisfaction,
  design = stratified_design
)
R

단순히 weighted.mean()을 사용하면 가중평균은 계산할 수 있지만 복합표본설계를 반영한 표준오차까지 자동으로 계산되지는 않는다.

표본추출에 층, 군집과 가중치가 포함되었다면 분석에서도 같은 설계를 반영해야 한다(Lumley, 2010).

조사보고서에는 표본추출 과정을 구체적으로 밝혀야 한다

보고서에 “대학생 1,000명을 조사했다”라고만 적으면 표본의 품질을 평가하기 어렵다.

최소한 다음 정보를 제공해야 한다.

  1. 목표모집단은 누구인가?
  2. 표본틀은 무엇인가?
  3. 표본추출 단위는 무엇인가?
  4. 확률표본인가, 비확률표본인가?
  5. 구체적인 추출방법은 무엇인가?
  6. 각 단계의 표본크기는 얼마인가?
  7. 응답률은 어떻게 계산했는가?
  8. 비응답자는 어떻게 처리했는가?
  9. 가중치는 어떻게 계산했는가?
  10. 층과 군집을 분석에 반영했는가?
  11. 조사방식은 대면, 전화, 우편 또는 온라인 중 무엇인가?
  12. 결과를 어느 모집단까지 일반화하는가?

비확률표본을 사용했다면 그 사실을 숨기기보다 선택기준과 해석의 한계를 명확히 제시해야 한다.

예를 들어 다음처럼 작성할 수 있다.

본 조사는 연구자가 담당하는 두 개 강의의 수강생을 대상으로 한 편의표본조사다. 결과는 참여 학생의 응답을 기술하며 전체 대학생 모집단으로 일반화하지 않는다.

이 문장은 연구의 한계를 드러내지만 동시에 결과를 정직하고 정확하게 해석하게 한다.

표본추출에서 자주 발생하는 오류

확률표본은 모든 사람의 선택확률이 같다고 생각한다

확률표본에서는 선택확률이 알려져 있고 0보다 커야 한다. 모든 사람의 선택확률이 같을 필요는 없다.

불균등한 선택확률은 가중치로 반영할 수 있다.

표본크기가 크면 대표성이 확보된다고 생각한다

표본크기는 무작위 표본오차와 관련이 있다. 포함오차와 자기선택편향은 표본크기만 늘려 해결할 수 없다.

온라인 조사는 모두 비확률표본이라고 생각한다

온라인은 자료수집 방식이다. 확률적으로 모집한 패널을 온라인으로 조사할 수도 있다.

반대로 모집단 명부에서 무작위로 이메일을 발송하더라도 응답자가 심하게 자기선택되면 최종 응답자료에는 비응답편향이 생길 수 있다.

인구통계 비율이 같으면 대표표본이라고 생각한다

성별, 연령과 지역 비율을 모집단에 맞추어도 관찰하지 않은 특성의 차이는 남을 수 있다.

표면적 구성의 유사성이 모든 변수의 대표성을 보장하지 않는다.

응답률이 높으면 편향이 없다고 생각한다

높은 응답률은 바람직하지만 편향의 크기는 응답자와 비응답자가 조사변수에서 얼마나 다른지에 달려 있다.

낮은 응답률과 높은 비응답편향은 같은 개념이 아니다.

군집표본을 단순무작위표본처럼 분석한다

같은 학교, 지역이나 가구의 구성원은 서로 비슷할 수 있다. 군집 내 상관을 무시하면 표준오차가 지나치게 작게 계산될 수 있다.

비확률표본에 단순한 표본오차를 붙인다

비확률표본은 포함확률을 알 수 없으므로 확률표본의 표본오차 공식을 그대로 적용하기 어렵다.

모형기반 불확실성을 계산할 수는 있지만, 이는 확률표본의 설계기반 오차한계와 같은 의미가 아니다.

표본설계를 선택하기 전에 확인할 질문

  1. 어떤 모집단에 대해 결론을 내리려는가?
  2. 목표모집단을 포함하는 표본틀이 존재하는가?
  3. 모집단 구성원의 포함확률을 알 수 있는가?
  4. 소수집단을 별도로 분석해야 하는가?
  5. 대상자가 지리적으로 넓게 분포하는가?
  6. 조사비용과 방문거리를 줄여야 하는가?
  7. 모집단 명부가 없거나 접근이 어려운가?
  8. 모집단의 평균과 비율을 추정하려는가?
  9. 경험과 메커니즘을 탐색하려는가?
  10. 비응답 가능성이 높은 집단은 누구인가?
  11. 가중치 계산에 사용할 모집단 정보가 있는가?
  12. 표본설계를 반영한 분석이 가능한가?

표본추출 방법은 통계 프로그램에서 나중에 선택하는 옵션이 아니다. 연구질문과 자료수집 단계에서 결정해야 하는 설계의 문제다.

누구를 뽑았는지가 무엇을 말할 수 있는지를 결정합니다

확률표본추출은 모집단 구성원의 포함확률을 표본설계에 따라 알 수 있는 방법이다. 단순무작위추출, 층화추출, 군집추출, 계통추출과 다단계추출이 여기에 포함된다.

이 방식은 모집단 추정과 표본오차 계산에 명확한 설계근거를 제공한다. 그러나 부정확한 표본틀, 비응답과 측정오차까지 자동으로 해결하지는 않는다.

비확률표본추출은 포함확률을 알 수 없는 방식이다. 편의표본, 자발적 참여표본, 할당표본, 목적표본과 눈덩이표본이 대표적이다.

이 방법들은 빠르고 현실적이며, 탐색적 연구나 접근하기 어려운 집단의 연구에서 유용하다. 그러나 결과를 모집단 전체의 비율이나 평균으로 일반화하려면 추가적인 가정과 보정이 필요하다.

비전공자는 다음 세 문장을 기억하면 된다.

표본이 크다고 반드시 대표적인 것은 아니다.

무작위로 뽑았더라도 표본틀이 잘못되면 모집단을 제대로 대표하지 못한다.

조사결과를 읽을 때는 몇 명을 조사했는지보다 먼저 누구를 어떻게 뽑았는지 확인해야 한다.

통계의 신뢰도는 분석기법에서만 만들어지지 않는다. 숫자가 만들어지기 전, 조사대상을 선택하는 순간부터 결정된다.

좋은 표본은 모집단의 축소판처럼 보이는 표본이 아니다. 어떤 과정을 통해 선택되었는지 설명할 수 있고, 그 과정에 맞게 추론의 범위를 정할 수 있는 표본이다.

참고문헌

Baker, R., Brick, J. M., Bates, N. A., Battaglia, M., Couper, M. P., Dever, J. A., Gile, K. J., & Tourangeau, R. (2013). Report of the AAPOR task force on non-probability sampling. Journal of Survey Statistics and Methodology, 1(2), 90–143. https://doi.org/10.1093/jssam/smt008

Bethlehem, J. (2010). Selection bias in web surveys. International Statistical Review, 78(2), 161–188. https://doi.org/10.1111/j.1751-5823.2010.00112.x

Brick, J. M. (2011). The future of survey sampling. Public Opinion Quarterly, 75(5), 872–888. https://doi.org/10.1093/poq/nfr045

Couper, M. P. (2000). Web surveys: A review of issues and approaches. Public Opinion Quarterly, 64(4), 464–494. https://doi.org/10.1086/318641

Elliott, M. R., & Valliant, R. (2017). Inference for nonprobability samples. Statistical Science, 32(2), 249–264. https://doi.org/10.1214/16-STS598

Groves, R. M., Fowler, F. J., Jr., Couper, M. P., Lepkowski, J. M., Singer, E., & Tourangeau, R. (2009). Survey methodology (2nd ed.). Wiley. https://doi.org/10.1002/9780470465462

Groves, R. M., & Peytcheva, E. (2008). The impact of nonresponse rates on nonresponse bias: A meta-analysis. Public Opinion Quarterly, 72(2), 167–189. https://doi.org/10.1093/poq/nfn011

Lumley, T. (2010). Complex surveys: A guide to analysis using R. Wiley. https://doi.org/10.1002/9780470580066

Meng, X.-L. (2018). Statistical paradises and paradoxes in big data (I): Law of large populations, big data paradox, and the 2016 US presidential election. The Annals of Applied Statistics, 12(2), 685–726. https://doi.org/10.1214/18-AOAS1161SF

Mercer, A., Kreuter, F., Keeter, S., & Stuart, E. A. (2017). Theory and practice in nonprobability surveys: Parallels between causal inference and survey inference. Public Opinion Quarterly, 81(S1), 250–271. https://doi.org/10.1093/poq/nfw060

Salganik, M. J., & Heckathorn, D. D. (2004). Sampling and estimation in hidden populations using respondent-driven sampling. Sociological Methodology, 34(1), 193–240. https://doi.org/10.1111/j.0081-1750.2004.00152.x

Särndal, C.-E., Swensson, B., & Wretman, J. (1992). Model assisted survey sampling. Springer. https://doi.org/10.1007/978-1-4612-4378-6

태그

#확률표본추출 #비확률표본추출 #단순무작위추출 #층화표본추출 #군집표본추출 #계통표본추출 #표본설계 #표본편향 #설문조사 #조사방법론 #R통계 #복합표본 #데이터리터러시

scroll to the top of the site