회귀분석 변수 선택법: 과적합을 피하고 해석력을 지키는 전략

회귀분석에서 변수를 줄이는 전진선택·후진제거·정보기준(AIC·BIC)·정규화(Ridge·Lasso)·트리 기반 중요도·통계적 검정 방법을 실제 사례와 함께 정리한다.

2026-08-13 · 최초 발행 2025-05-23

회귀분석은 다양한 현업에서 쓰이는 데이터 기반 의사결정 도구이지만, 모델에 넣은 변수가 전부 유의미한 것은 아니다. 어떤 변수를 남기고 어떤 변수를 걷어낼지가 모델의 성능과 해석력을 가른다.

변수를 줄여야 하는 이유

불필요한 변수를 포함하면 훈련 데이터에 과도하게 적합해 일반화 성능이 떨어진다(과적합). 반대로 적은 수의 중요 변수로 모델을 구성하면 결과 해석이 명확해지고, 상관관계가 높은 변수들 사이의 다중공선성 문제도 줄어든다. 변수 수가 줄면 계산 리소스도 절약되고 처리 속도도 개선되며, 종속변수와 관계없는 노이즈 변수가 모델에 섞여 들어가는 것도 막을 수 있다.

전진 선택, 후진 제거, 그리고 그 사이의 단계적 방법

전진 선택법(Forward Selection)은 절편만 있는 가장 단순한 모델에서 시작해, 각 단계마다 아직 포함되지 않은 변수 중 가장 유의미한 것을 추가하고, 더 이상 유의미한 변수가 없을 때까지 반복한다.

YesNo절편만 있는 모델변수 추가유의미한 개선?최종 모델

주택 가격 예측 모델이라면 처음에는 면적만 포함하고, 점차 방 개수·위치·건축 연도 등을 단계적으로 추가하는 식이다.

후진 제거법(Backward Elimination)은 반대 방향이다. 모든 변수를 포함한 모델에서 시작해 각 단계마다 가장 덜 유의미한 변수를 제거하고, 남은 변수가 모두 유의미할 때까지 반복한다.

NoYes모든 변수 포함 모델변수 제거모든 변수가 유의미?최종 모델

고객 이탈 예측 모델에서 초기에 50개 변수로 시작해 p-value가 높은 변수들을 순차적으로 제거하면 15개 핵심 변수만 남는 식이다.

단계적 방법(Stepwise Selection)은 두 방법을 결합한다. 각 단계에서 변수를 추가한 뒤 유의하지 않아진 변수는 없는지 다시 검토하며, 더 이상 변화가 없을 때까지 반복한다.

YesNo절편만 있는 모델변수 추가유의하지 않은 변수 제거모델 변화?최종 모델

신용 리스크 평가 모델에서 고객 정보, 거래 이력, 외부 데이터 등을 단계적으로 평가해 최적의 변수 조합을 찾는 방식이 여기 해당한다.

AIC·BIC·Mallow's Cp로 모델 복잡도를 재는 법

정보 기준 기반 방법은 모델의 복잡성과 적합도 사이의 균형을 수치로 평가한다.

AIC(Akaike Information Criterion)는 AIC = -2ln(L) + 2k (L: 가능도, k: 파라미터 수)로 계산하며, 낮은 값을 가진 모델이 선호된다. 시계열 분석에서 ARIMA 모델의 최적 차수(p,d,q)를 정할 때 조합별 AIC를 비교하는 식으로 쓰인다.

BIC(Bayesian Information Criterion)는 BIC = -2ln(L) + k·ln(n) (n: 샘플 수)로, AIC와 유사하지만 샘플 크기에 따른 페널티가 붙어 AIC보다 더 간결한 모델을 선호하는 경향이 있다. 마케팅 믹스 모델링에서 다양한 광고 채널 효과를 분석할 때 BIC 기준으로 최적 변수 조합을 고르는 데 쓰인다.

Mallow's Cp는 Cp = (SSEp/MSEfull) - (n - 2p)로 예측 오차와 모델 복잡성의 균형을 본다. Cp 값이 변수 수 p에 가까울수록 적절한 모델로 본다. 제조 공정 최적화 분석에서 다양한 요인의 영향력을 평가할 때 Cp 통계량을 활용한다.

Ridge·Lasso·Elastic Net — 정규화로 계수를 다스린다

정규화 기반 방법은 비용 함수에 페널티 항을 더해 계수를 통제한다.

Ridge Regression(L2 정규화)은 RSS + λΣβj² 형태로 계수 제곱합에 페널티를 준다. 계수를 0으로 만들지는 않지만 크기를 축소시켜 다중공선성 문제 해결에 효과적이다.

원본 데이터Ridge Regression축소된 계수들모든 변수 유지

유전체 데이터 분석에서 수천 개의 유전자 변수 간 상관관계가 높을 때 Ridge 회귀로 안정적인 계수를 추정하는 데 쓰인다.

Lasso Regression(L1 정규화)은 RSS + λΣ|βj| 형태로 계수 절대값 합에 페널티를 준다. 일부 계수를 정확히 0으로 만들어 변수 선택 효과를 내며, 희소 모델(sparse model)을 만드는 데 유용하다.

원본 데이터Lasso Regression일부 계수 0으로 설정변수 부분집합 선택

센서 데이터 기반 예측 모델에서 수백 개 특성 중 20개만 비zero 계수로 남겨 해석 가능한 모델을 만드는 사례가 여기 해당한다.

Elastic Net은 RSS + λ₁Σ|βj| + λ₂Σβj²로 Ridge와 Lasso를 혼합한 방법이다. 높은 상관관계를 가진 변수 그룹에서도 효과적이며 두 정규화의 장점을 함께 얻는다. 소셜 미디어 데이터 기반 트렌드 예측에서 관련 키워드들을 그룹화하면서 중요 변수를 고르는 데 쓰인다.

트리 모델이 알려주는 변수 중요도

Random Forest 변수 중요도는 각 변수의 분할 품질을 평가하고, 변수 순열화(permutation)를 통한 중요도 평가나 OOB(Out-of-Bag) 오류 증가로도 중요도를 측정한다.

Random Forest 모델 구축 트리에서 변수 중요도 계산변수 평균 중요도 산출중요도 기준 변수 선택

통신사 고객 이탈 예측에서 Random Forest 중요도 점수로 상위 20개 변수만 골라 모델을 단순화하고 이해도를 높인 사례가 있다.

Gradient Boosting 변수 중요도는 모델 학습 과정에서 각 변수가 손실 함수 감소에 기여한 정도를 측정한다. 더 자주, 더 높은 위치에서 분할에 쓰인 변수일수록 중요하게 평가된다. 주식 시장 예측 모델에서 XGBoost 중요도를 기반으로 기술적·기본적 지표 중 유의미한 변수를 가려낸 사례가 있다.

F-검정과 t-검정으로 유의성을 확인한다

F-test는 전체 모델과 제한된 모델 간의 적합도를 비교해 각 변수 또는 변수 그룹의 유의성을 평가한다. 중첩 모델(nested models) 비교에 적합하며, 임상 시험 데이터 분석에서 처리 그룹과 다양한 인구통계학적 변수들의 상호작용 효과를 검증하는 데 쓰인다.

t-test는 개별 회귀 계수의 유의성을 검정한다. 귀무가설은 βj = 0(j번째 변수가 영향 없음)이며, p-value < α인 변수를 선택한다. 경제지표가 인플레이션에 미치는 영향을 분석할 때 각 지표별 t-검정으로 유의성을 평가하는 식이다.

방법을 한눈에 정리하면

변수 선택 방법전통적 방법정보 기준 기반정규화 기반트리 기반통계적 검정전진 선택법후진 제거법단계적 방법AICBICMallow's CpRidgeLassoElastic NetRandom ForestGradient BoostingF-testt-test

데이터가 소규모면 전통적 방법이나 정보 기준 기반 방법이, 대규모면 정규화나 트리 기반 방법이 적합하다. 변수 간 상관관계가 높다면 Ridge나 Elastic Net을, 변수 그룹 선택이 필요하면 Lasso나 Elastic Net을 고려한다. 높은 해석력이 필요하면 전통적 방법이나 Lasso를, 예측력을 중시하면 트리 기반이나 정규화 방법을 택한다. 빠른 계산이 필요하면 전진 선택법이나 트리 기반 방법을, 정확한 결과를 중시하면 정규화 방법이나 단계적 방법을 쓴다.

현업에서는 이런 순서로 적용한다

데이터 전처리(결측치 처리, 이상치 감지, 표준화)로 시작해 변수 간 상관관계와 기초 통계량을 살피는 초기 탐색 분석을 거친다. 데이터 특성과 목적에 맞는 방법론을 고르고, k-fold 교차 검증으로 변수 선택의 안정성을 확인한다. RMSE·R²·AIC·BIC 같은 지표로 모델을 평가한 뒤, 최종 선택된 변수 세트로 모델을 미세 조정한다.

놓치기 쉬운 함정들

순수 통계적 접근만으로는 중요한 인과관계를 간과할 수 있어, 전문가 의견과 통계적 결과 사이의 균형이 필요하다. 작은 데이터 변화에도 선택된 변수 세트가 달라지는 불안정성이 있어 부트스트래핑 같은 안정성 검증이 권장된다. 변수 선택은 예측력 향상이 목적이지 인과관계를 증명하지 않으므로, 인과 추론이 목적이라면 다른 접근법이 필요하다. 고차원 데이터에서는 일부 방법의 계산 비용이 매우 높아 효율적 구현이나 근사 알고리즘을 고려해야 한다.

자동화와 인과 추론 쪽으로 가는 흐름

AutoML 플랫폼은 자동 변수 선택 기능을 제공하며, 여러 방법을 앙상블해 안정적인 변수 세트를 도출하는 방향으로 발전하고 있다. 베이지안 접근법은 불확실성을 정량화해 변수 중요도를 평가하고 모델 공간 탐색으로 최적 변수 조합을 찾는다. 단순 예측이 아니라 인과 관계를 고려한 변수 선택으로 도메인 지식과 데이터 기반 접근을 결합하려는 흐름도 있다. 신경망 아키텍처에서는 어텐션 메커니즘을 통해 특성 중요도를 측정하는 방향으로 확장되고 있다.

변수선택회귀분석정규화특성선택다중공선성