응답 편향과 가중치 조정, IRT로 설문 추론 다듬기
응답 바이어스 진단, 가중치 조정, 문항반응이론(IRT)을 결합해 설문 대표성과 측정정밀도를 관리하는 방법
2026-08-14 · 최초 발행 2024-04-29
설문 결과가 왜곡되는 지점은 수집 이후에도 남는다
대규모 설문자료는 응답을 모은 뒤에도 대표성 문제와 측정오차를 함께 안고 있다. 무응답이나 사회적 바람직성, 측정도구 편향은 표본을 모집단과 다르게 만들고, 문항 자체의 난이도와 변별도는 점수 해석에 영향을 준다.
Response Bias는 이런 이유로 표본이 모집단을 충분히 대표하지 못하게 되는 체계적 왜곡이다. 설문 설계, 수집, 처리의 전 단계에서 나타날 수 있다.
Weighting Adjustments는 표본추출 확률과 무응답, 인구통계 기준을 반영해 가중치를 산출하고 조정하는 과정이다. 사후층화나 래이킹을 통해 바이어스를 줄이고, 모집단에 대한 추론의 대표성을 회복하는 데 목적이 있다.
Item Response Theory(IRT)는 문항 난이도·변별도와 필요 시 추측도, 그리고 응답자의 잠재특성(θ) 사이의 관계로 응답 확률을 모델링하는 통계 프레임워크다. 분석 목적과 데이터 특성에 따라 1PL, 2PL, 3PL 모형을 사용한다.
표본 편향과 응답 품질을 먼저 확인한다
사후층화 변수별로 표본과 모집단의 분포 차이를 비교하면 과소대표집 또는 과대표집이 일어난 지점을 확인할 수 있다. 표준화 잔차와 오즈비는 그 수준을 점검하는 데 사용한다.
무응답률, 중도포기, 일관성 검사 같은 패널티 기반 품질 지표도 함께 본다. 품질이 떨어진 응답에는 가중치를 낮추거나 제외하는 정책을 적용할 수 있다.
가중치에는 추출·무응답·보정의 조건이 함께 들어간다
기본 가중치는 다음 요소를 결합해 설계한다.
- 1/추출확률
- 무응답 보정 계수
- 캘리브레이션 계수(래이킹/사후층화)
극단적인 가중치는 분산을 키우고 디자인 효과를 악화시킬 수 있다. 상위 p백분위를 절단하는 가중치 트리밍과 재정규화로 이를 제어하며, 디자인 효과 관리까지 함께 고려한다.
IRT는 점수 합산만으로 보이지 않는 문항 특성을 다룬다
IRT 모형은 데이터와 분석 목적에 맞춰 선택한다. 1PL은 난이도, 2PL은 난이도와 변별도, 3PL은 추측도까지 포함한다.
추정 전후에는 단일차원성과 국소독립성 가정을 점검해야 한다. 아이템핏 통계인 S-X2 등과 정보함수를 사용하면 문항의 적합성과 측정 기여도를 평가할 수 있다.
가중치를 적용한 추정치와 IRT 기반 잠재특성 추정치를 함께 보고하면 설문 점수를 더 공정하고 정확하게 비교할 수 있다. 코드, 시드, 버전을 고정하고 검증용 샘플을 재분석하며, 변경 관리와 로그 기반 추적을 운영에 포함한다.
조사 목적에 따라 결합 방식이 달라진다
공공 여론조사에서는 지역·연령·성별 기준으로 래이킹한 뒤 후보 선호도를 추정할 수 있다. 사회적 바람직성 바이어스를 줄이기 위해 문항 순서와 익명화 설계도 병행한다.
고객 만족도 조사(CSAT/NPS)에서는 웹·모바일·콜센터처럼 채널별 응답 편향을 보정하고 가중 평균을 산출한다. 핵심 문항은 2PL로 난이도와 변별도를 다시 평가할 수 있다.
교육 평가 설문은 강의평 문항의 IRT 적합 후 강좌와 교원을 비교할 때 θ-점수를 사용한다. 성·전공·학년 기준의 가중치 캘리브레이션도 함께 적용한다.
직원 참여도(Engagement) 진단에서는 부서·직급·근속별 무응답을 보정하고 극단 가중치를 트리밍한다. 항목군별 잠재요인 점수는 부서 간 비교의 공정성을 높이는 데 사용된다.
대표성·추론·측정정밀도에서 기대할 수 있는 변화
인구 기준에 맞춰 가중치를 조정하면 편향을 줄일 수 있다. 예를 들어 가중치 적용 전후 고령층 비중 오차는 6%p에서 1%p로 달라질 수 있다.
가중치와 복제가중치 분산추정(BRR/JK)을 적용하면 신뢰구간의 정확성을 높일 수 있으며, RMSE는 데이터와 설계에 따라 515% 감소를 기대한다. IRT 정보함수를 바탕으로 문항을 다시 설계하면 평균 측정오차(SEM)를 1030% 줄일 수 있다.
가중치 트리밍과 수렴 진단은 디자인 효과를 관리하고 파이프라인 장애를 줄이는 운영 수단이 된다.
표본 크기 n = 2,000, 디자인 효과 DEFF = 1.5를 가정하면 유효 표본크기 n_eff = n / DEFF = 2,000 / 1.5 ≈ 1,333이다. 표준오차는 단순무작위 대비 √DEFF 배 증가한다.
진단부터 리포팅까지 이어지는 흐름
극단 가중치는 상한·하한 트리밍 후 총합 제약 하에서 보정한다. IRT가 수렴하지 않으면 초기값을 다중화하고, 단순모형에서 복잡모형으로 점진적으로 늘리거나 문제 문항을 제거한다. 결측 문항은 다중대치 또는 IRT 기반 FIML로 처리한다.
가중치 조정과 IRT를 운영할 때의 차이
| 방법 | 성능(바이어스 교정) | 확장성(대규모) | 일관성(추정 안정) | 안정성(수렴/극단값) | 운영 편의 |
|---|---|---|---|---|---|
| 가중치 조정(래이킹/사후층화) | 중~높음 | 높음 | 중간 | 극단 가중치 관리 필요 | 높음 |
| IRT(1PL/2PL/3PL) | 측정오차 교정에 높음 | 중간 | 높음(충분 표본 시) | 국소독립/수렴 이슈 | 중간 |
| 단순 비가중/합산 점수 | 낮음 | 매우 높음 | 낮음 | 높음 | 매우 높음 |
가중치 조정은 대표성을 높이는 대신 분산을 증가시킬 수 있다. 트리밍과 복제가중치로 균형을 맞춘다.
IRT는 정밀한 추정을 제공하지만 모형 가정과 계산 복잡도가 커진다. 데이터 크기와 품질이 전제가 된다.
산출과 적합성 검토에서 확인할 항목
가중치 산출에서는 성·연령·지역과 채널·교육·소득 등 2~3개 핵심 변수를 기준으로 잡는다. 래이킹 목표 마진과 허용오차를 정하고 수렴 기준을 설정한다. weight CV, max/min 비율, DEFF, n_eff도 보고 대상에 포함한다.
IRT 적용 전에는 EFA/parallel analysis를 통한 단일차원성 탐색과 국소독립성 잔차 검사를 수행한다. 정보함수 분포를 확인한 뒤 1PL에서 2PL, 3PL로 단계적으로 확장하고, 아이템핏과 DIF(집단간 문항 편의)를 검토해 문제 문항을 조정한다.
재현 가능한 분석 코드
전제조건은 다음과 같다.
- R >= 4.2
- 패키지: survey(>=4.2), mirt(>=1.39)
- 데이터: df 응답자료, pop 마진테이블 존재 가정
# install.packages(c("survey","mirt"))
library(survey)
library(mirt)
# 1) 가중치: 기본가중치와 래이킹
# df: id, strata, psu, base_w, sex, agegrp, region, y(이분 또는 연속)
# pop: list 형태의 인구분포 (예: list(~sex, sex_dist, ~agegrp, age_dist, ...))
design0 <- svydesign(ids=~psu, strata=~strata, weights=~base_w, data=df, nest=TRUE)
# 래이킹 캘리브레이션
cal <- calibrate(design0, formula = ~sex + agegrp + region, population = pop, bounds=c(0.3, 3))
# 극단 가중치 트리밍(선택)
w <- weights(cal)
trim_w <- pmin(w, quantile(w, 0.99))
trim_w <- pmax(trim_w, quantile(w, 0.01))
design <- svydesign(ids=~psu, strata=~strata, weights=~trim_w, data=df, nest=TRUE)
# 추정 및 품질지표
svymean(~y, design) # 가중 평균
deff(design) # 디자인 효과
neff <- nrow(df) / as.numeric(deff(design)) # 유효 표본크기
# 2) IRT: 2PL 모형 적합
# 문항: Q1~Q10 (이분 문항)
items <- df[, paste0("Q", 1:10)]
model <- mirt(items, 1, itemtype = "2PL", SE=TRUE)
coef(model, IRTpars=TRUE, simplify=TRUE)$items # 난이도/변별도
theta <- fscores(model, method="EAP") # 응답자 θ 점수
itemfit(model) # 아이템 핏 점검
복제가중치(BRR/JK)는 분산추정의 일관성을 확보하는 데 사용한다. IRT 수렴에 실패하면 θ 초기값을 난수로 다중 시도하고, 고정된 추측도(2PL)로 단순화한 뒤 3PL로 확장한다.