데이터 이상값 탐지와 처리: 통계 지표부터 마할라노비스 거리까지

데이터 이상값의 발생 원인, 통계값·시각화·마할라노비스 거리·LoF·iForest 기반 검출법, 삭제·대체·변환·박스플롯 처리 방법을 정리한다.

2026-08-13 · 최초 발행 2025-05-23

72kg이어야 할 체중 데이터가 720kg으로 찍히는 순간, 그 관측치 하나가 뒤에 이어지는 통계 분석과 모델 학습 전체를 흔든다. 이상값(Outlier)은 일반적인 데이터 분포에서 크게 벗어나는 관측치를 의미하며, 데이터 기반 의사결정의 비중이 커질수록 이를 발생 원인부터 검출·처리까지 체계적으로 다루는 일의 중요성도 함께 커진다.

이상값 하나가 분석 결과를 왜곡하는 이유

이상값을 방치하면 통계적 분석 결과가 왜곡되고, 머신러닝 모델의 학습 성능도 저하된다. 데이터 품질 관리 관점에서 이상값 처리가 중요한 이유가 여기에 있다.

전처리 파이프라인에서 이상값이 자리하는 지점

데이터 분석은 수집→처리→전처리(결측치·이상치·노이즈 처리)→영향도 분석으로 이어지는 일련의 프로세스로 진행되며, 이상값 처리는 이 가운데 전처리 단계에서 이뤄진다. 전체 분석 결과의 품질을 결정짓는 과정이다.

데이터 수집데이터 처리영향도 분석결측치 처리이상치 처리노이즈 처리전처리정확도/신뢰도 향상편향 최소화

정제부터 변환까지, 이상값이 지나는 전처리 단계

데이터 정제(Data Cleaning)는 결측치·이상치 제거 과정이다. 일관성 유지를 위해 데이터 형식을 통일하는 변환(Transform), 데이터 구조를 분석하는 파싱(Parsing), 부족한 데이터를 보완하는 보강(Enhancement)을 거치며, ETL(Extract, Transform, Load), MapReduce, Spark/Storm, Flume이 주요 정제 기술로 쓰인다.

데이터 통합(Data Integration)은 호환성을 위해 데이터를 통합하는 단계로, 데이터 중복 제거(Correlation analysis)를 수행하고 다양한 소스의 데이터를 통합할 때 발생하는 충돌을 해결한다.

데이터 축소(Data Reduction)는 데이터 완결성을 유지하며 용량을 줄이는 단계다. 차원을 줄이는 주성분분석(PCA), 유사 데이터를 묶는 클러스터링(Clustering), 대표 데이터를 추출하는 샘플링(Sampling), 변수를 줄이는 차원축소(Dimension Reduction)가 주요 기법이다.

데이터 변환(Data Transformation)은 데이터 형식과 구조를 바꾸는 단계로, 척도를 통일하는 정규화(Normalization), 데이터를 요약하는 집합화(Aggregation), 분포를 균등화하는 평활화(Equalization), 핵심 정보를 추출하는 요약(Summarization), 데이터를 구조화하는 계층 생성이 여기에 포함된다.

입력 실수부터 의도적 조작까지 벌어지는 이유

이상값은 다양한 원인에 의해 발생하며, 원인에 따라 처리 방법이 달라진다.

입력 오류는 데이터 입력 과정에서 발생하는 실수다.

예: 체중 데이터 입력 시 72kg을 720kg으로 오입력

측정 오류는 측정 장비나 방법의 오류에서 비롯된다.

예: 센서 오작동으로 인한 비정상적 온도 측정

실험 오류는 실험 과정에서 변수 통제가 실패할 때 발생한다.

예: 약물 실험 중 외부 요인 개입으로 인한 이상 결과

고의적 오류는 의도적인 데이터 조작이다.

예: 보험 사기를 위한 의도적 데이터 왜곡

표본 추출 오류는 비대표적 표본 추출로 인한 오류다.

예: 특정 집단에 편중된 설문조사 결과

관찰과 통계, 시각화로 이상값을 잡아내는 법

개별 데이터 관찰에서는 시계열 데이터의 변화 패턴을 보는 데이터 추이 분석, 일반적 패턴에서 벗어난 데이터를 식별하는 특이사항 확인이 기본이다. 모든 데이터가 동일한 확률로 선택되는 단순무작위추출, 일정 간격으로 데이터를 선택하는 체계적 추출, 하위 그룹별로 비율을 맞춰 추출하는 층화추출, 유사한 특성의 그룹 단위로 추출하는 군집추출 같은 무작위 표본추출 기법도 함께 쓰인다.

통계값 활용에서는 평균·중앙값·최빈값 같은 집중화 경향 지표, 최댓값·최솟값·범위·사분위편차·분산·표준오차 같은 산포도 지표, 첨도(분포의 뾰족한 정도)·왜도(분포의 비대칭 정도) 같은 분포 지표를 본다.

데이터 시각화 기법은 목적에 따라 나뉜다. 시간 시각화는 막대그래프·간트차트로, 분포 시각화는 파이차트·트리맵·누적연속그래프로, 관계 시각화는 스캐터플롯·버블차트·히스토그램으로 이상값의 흔적을 드러낸다.

데이터 시각화시간 시각화분포 시각화관계 시각화막대그래프간트차트파이차트트리맵누적연속그래프스캐터플롯버블차트히스토그램

고급 이상값 검출 기법으로는 데이터를 K개 클러스터로 나눠 중심에서 멀리 떨어진 데이터를 이상값으로 판단하는 K-평균 알고리즘, 데이터 밀도와 분산을 고려한 다변량 이상값 검출법인 마할라노비스 거리(Mahalanobis distance)가 쓰인다.

MD(x) = √[(x - μ)^T Σ^(-1) (x - μ)]
(μ: 평균 벡터, Σ: 공분산 행렬)

LoF(Local Outlier Factor)는 관측치 주변 밀도를 이용한 국소적 관점의 이상값 검출법으로, 하이퍼-파라미터를 기준으로 주변 데이터 개수를 정하고 밀도가 주변보다 현저히 낮은 데이터를 이상값으로 판단한다. iForest(Isolation Forest)는 의사결정나무 기반 데이터마이닝 기법으로, 정상 데이터보다 이상값이 더 빨리 고립(isolation)된다는 원리를 활용해 랜덤 분할로 데이터를 분리하고 분리 횟수가 적을수록 이상값일 가능성이 높다고 본다.

삭제·대체·변환·분류, 다루는 방식을 고르는 기준

이상값 검출 후에는 적절한 처리 방법을 선택해야 한다.

삭제(Deleting Observations)는 이상값으로 판단되는 관측값을 제외하는 방법이다. 분포의 양 끝에 있는 극단값을 제거하는 양극단값 절단(Trimming)이 대표적이며, 로그 변환 후 평균을 기준으로 제거하는 기하평균 이용 제거, 하위 또는 상위 일정 비율의 데이터를 제거하는 하단·상단 % 이용 제거 같은 극단값 절단 기법이 쓰인다.

대체법(Imputation)은 하한값과 상한값을 결정한 뒤 대체하는 방법이다. 단일대체법에는 이상값을 평균값으로 대체하는 평균대체법, 논리적 규칙에 따라 대체하는 연역적 대체법, 다른 변수와의 관계로 예측값을 대체하는 회귀 대체법, 유사한 특성의 데이터로 대체하는 일치대응 대체법, 무작위로 선택된 유사한 값으로 대체하는 Hot-Deck 대체법이 있다. 여러 가능한 값을 생성해 불확실성을 반영하는 다중대체법도 쓰인다.

변환(Transformation)은 극단적 값을 자연로그로 바꿔 값을 줄이는 방법이다.

예: 소득 데이터 10억 → ln(10억) = 20.72

상·하한 값을 벗어나는 값을 하한·상한으로 바꿔 활용하는 Winsorizing도 변환의 한 방식이다.

예: 1, 2, 3, 4, 5, 20, 50 → 1, 2, 3, 4, 5, 5, 5 (상위값 Winsorizing)

박스플롯(Box-Plot) 활용은 사분위수를 이용해 이상값을 제거하는 방법으로, 해석 방법은 다음과 같다.

하한 경계 = Q1 - 1.5 × IQR
상한 경계 = Q3 + 1.5 × IQR
(Q1: 1사분위수, Q3: 3사분위수, IQR: 사분위 범위)

수염(Whiskers) 바깥쪽 데이터는 이상값으로 처리한다. 가격 데이터를 예로 들면 Q1이 20, 중앙값이 50, Q3가 70이고 수염이 0~100 구간을 덮을 때, 120·130·150처럼 그 범위를 벗어난 값이 이상값으로 표시된다.

분류(Classification)는 이상값이 많은 경우 그룹화해 처리하는 방법이다. 서로 다른 그룹으로 데이터를 분류하고, 각 그룹별로 통계적 모형을 만든 뒤, 분석 결과를 결합하는 절차를 거친다. 각 그룹 내에서의 상대적 이상값을 검출하는 그룹별 이상치 판별이 핵심이다.

금융·제조·의료 현장에서 이상값을 다루는 절차

금융 분야 사기 거래 탐지에서는 신용카드 거래 데이터의 거래 금액·시간·위치 등을 다변량 분석하고, LoF 알고리즘으로 이상 거래 패턴을 검출하며, 이전 거래 패턴과의 마할라노비스 거리를 계산해 임계값을 초과한 거래에 알림을 보낸다.

제조업 품질 관리에서는 생산 라인 센서 데이터를 시계열 시각화로 1차 검출한 뒤 박스플롯으로 통계적 이상값을 판별하고, 이상값 발생 원인을 측정 오류인지 실제 공정 이상인지 분석해 측정 오류는 대체, 공정 이상은 알림으로 차별화해 처리한다.

의료 데이터 분석에서는 의학적 지식을 기반으로 정상 범위를 설정하고, iForest 알고리즘으로 비정상 패턴을 검출하며, 단기 이상값과 장기 추세를 구분해 분석한 뒤 이상값 발생 시 의료진에게 알리고 자동으로 기록한다.

데이터 이상값 관리는 데이터 품질 확보와 신뢰성 있는 분석 결과 도출을 위한 필수 과정이다. 이상값 발생 원인에 대한 이해와 적절한 검출·처리 방법론 적용을 통해 데이터 기반 의사결정의 정확성을 높일 수 있으며, 데이터의 특성과 분석 목적에 맞는 처리 전략을 세우되 단순 제거보다는 원인 분석을 통한 차별화된 접근이 필요하다.

데이터이상값통계분석이상치검출박스플롯데이터전처리