SEMMA: SAS Enterprise Miner의 데이터 마이닝 프로세스

SAS Institute가 만든 SEMMA(Sample-Explore-Modify-Model-Assess)의 각 단계와 SAS Enterprise Miner 연계, CRISP-DM과의 차이, 산업별 적용 사례를 정리한다.

2026-08-13 · 최초 발행 2025-05-23

데이터 기반 의사결정이 중요해진 비즈니스 환경에서 데이터 마이닝 프로세스를 관리하는 방법론은 프로젝트 성공의 핵심 요소다. SAS Institute가 만든 SEMMA(Sample, Explore, Modify, Model, Assess)는 데이터 마이닝 프로젝트를 체계적으로 수행하기 위한 프레임워크로, 특히 SAS Enterprise Miner 도구를 쓰는 환경에서 널리 활용된다.

SAS 도구와 함께 자란 방법론

SEMMA는 데이터 마이닝 프로세스의 표준화와 효율화를 목적으로 설계됐고, SAS Enterprise Miner 소프트웨어의 프로세스 흐름과 긴밀하게 연결돼 있다. 각 단계는 독립적이면서도 상호 연결된 작업으로 구성된다. 단순한 선형 프로세스가 아니라 반복적(iterative) 접근을 강조해, 필요에 따라 이전 단계로 돌아가 프로세스를 재정의하거나 개선할 수 있는 유연성을 제공한다.

표본을 추출하고 패턴을 탐색하는 단계

전체 데이터셋에서 분석 목적에 적합한 표본을 추출하는 Sample 단계는 데이터의 크기와 복잡성을 관리 가능한 수준으로 조정하는 게 목적이다. 통계적으로 유의미한 표본 크기를 정하고, 무작위 추출·층화 추출 같은 기법을 적용하며, 훈련용·검증용·테스트용 데이터셋으로 분할한다. 대형 소매업체는 수백만 건의 거래 데이터 중 10%를 무작위로 추출해 초기 모델 개발에 활용하고, 최종 모델은 전체 데이터셋으로 검증하는 방식으로 시간 효율성을 높인 사례가 있다.

Explore 단계는 데이터의 분포, 변수 간 관계, 이상치, 결측값을 파악하는 탐색적 분석이다. 기술 통계량 분석, 시각화 도구를 활용한 패턴 탐색, 상관관계 분석, 이상치·결측값 패턴 확인이 주요 작업이다. 은행의 신용평가 모델 개발 과정에서 고객 연령과 소득 사이의 비선형 관계를 히트맵으로 시각화해 특정 연령대에서 소득 불균형이 신용도에 미치는 영향을 발견한 사례가 있다.

데이터를 다듬고 모델을 세우는 단계

Modify 단계는 데이터 전처리·변환을 통해 모델링에 적합한 형태로 데이터를 준비하는 과정이다. 결측값 처리, 이상치 처리, 로그 변환·정규화 같은 변수 변환, PCA 같은 차원 축소, 파생 변수 생성, 범주형 변수 인코딩이 포함된다. 통신회사의 고객 이탈 예측 모델에서는 '최근 통화량', '최근 데이터 사용량', '고객 서비스 접촉 빈도'를 결합해 '고객 활동성 지수'라는 예측력 있는 파생 변수를 만든 사례가 있다.

Model 단계는 데이터 마이닝 기법을 적용해 예측·분류 모델을 구축하는 과정이다. 의사결정트리·회귀분석·신경망·앙상블 등 목적에 맞는 기법을 선택하고, 매개변수를 조정하며, 다양한 알고리즘을 실험·비교한 뒤 학습과 초기 평가를 수행한다. 제조업체는 설비 고장 예측을 위해 의사결정트리, 랜덤 포레스트, 그래디언트 부스팅 모델을 동시에 개발해 성능을 비교한 후, 최종적으로 그래디언트 부스팅 모델을 채택해 예방 정비 일정을 최적화한 사례가 있다.

결과를 평가하는 단계

Assess 단계는 구축된 모델의 성능과 비즈니스 가치를 평가하는 과정이다. 테스트 데이터셋으로 성능을 평가하고, 혼동 행렬·ROC 곡선·리프트 차트 같은 지표를 분석하며, 여러 모델의 성능을 비교하고 비즈니스 가치·ROI를 추정하며 결과를 해석·시각화한다. 보험사는 사기 탐지 모델을 평가할 때 단순 정확도보다 비용-편익 분석을 통해 오탐과 미탐지로 인한 비용을 함께 고려해 최적의 임계값을 설정한 사례가 있다.

SAS Enterprise Miner 안에서 흐르는 방식

모델 개선 필요모델 개선 필요모델 개선 필요최종 모델데이터 소스 지정Sample 단계Explore 단계Modify 단계Model 단계Assess 단계모델 배포

SAS Enterprise Miner는 SEMMA 방법론을 구현하기 위한 직관적인 인터페이스와 도구를 제공한다. 각 단계에 해당하는 노드(기능)를 드래그 앤 드롭으로 연결해 워크플로우를 시각적으로 구성할 수 있고, 각 단계에 필요한 알고리즘·분석 도구가 기본 제공된다. 구축된 프로세스 흐름을 저장해 다른 프로젝트에 재사용할 수 있다는 점도 특징이다.

CRISP-DM과 나란히 놓고 보면

특성 SEMMA CRISP-DM
단계 수 5단계 6단계
범위 기술적 프로세스 중심 비즈니스 이해부터 배포까지 포괄
시작점 데이터 샘플링 비즈니스 이해
도구 연계 SAS Enterprise Miner와 긴밀히 연계 도구 독립적
유연성 중간 높음
적용 산업 다양한 산업 다양한 산업

CRISP-DM은 '비즈니스 이해' 단계를 명시적으로 포함해 비즈니스 목표와의 연계를 강조하고 '배포' 단계를 별도로 구분해 실제 구현·유지보수를 강조하는 반면, SEMMA는 더 기술적인 접근에 초점을 맞춘다.

SAS 생태계 안에서는 강하고 밖에서는 제한적이다

데이터 마이닝 프로젝트의 주요 단계를 명확하게 정의하고, SAS Enterprise Miner와 완벽하게 통합돼 사용 편의성을 제공하며, 각 단계에서 이전 단계로 돌아가 개선할 수 있는 반복적 유연성을 갖췄고, 잘 정의된 단계로 프로젝트 관리 효율성을 높인다는 게 SEMMA의 장점이다.

반면 비즈니스 이해와 요구사항 정의 단계가 명시적으로 포함되지 않고, SAS Enterprise Miner를 쓰지 않는 환경에서는 적용이 제한적일 수 있으며, 모델 개발 후 실제 환경에 배포하는 과정에 대한 명시적 가이드가 부족하고, 데이터 수집·통합 같은 초기 준비 단계에 대한 지침도 제한적이라는 게 단점으로 꼽힌다.

금융·통신·제조가 SEMMA를 쓰는 방식

대형 금융기관이 신용 리스크 모델을 개발한 사례를 보면, Sample 단계에서 고객 신용 데이터의 표본을 추출해 훈련·검증·테스트셋으로 나누고, Explore 단계에서 소득·부채·신용 기록 같은 신용 변수의 분포와 관계를 분석하며, Modify 단계에서 결측치를 대체하고 이상치를 처리하며 신용점수를 정규화하고 파생변수를 만든다. Model 단계에서는 로지스틱 회귀·의사결정트리·랜덤 포레스트 등을 비교 실험하고, Assess 단계에서 ROC 곡선·혼동행렬·리프트 차트로 성능을 비교하며 비즈니스 영향을 분석한다.

통신회사의 고객 이탈(Churn) 예측 프로젝트는 최근 2년간 고객 데이터에서 이탈 고객과 유지 고객을 균형 있게 샘플링하고, 서비스 이용 패턴·불만 신고 기록·결제 이력을 탐색하며, 고객 행동 지표를 만들고 범주형 변수를 인코딩한 뒤 생존 분석·그래디언트 부스팅·인공신경망 모델을 구축해 예측 정확도·정밀도·재현율을 비교하고 이탈 방지 캠페인의 ROI를 추정한다.

제조 공정 개선 프로젝트는 다양한 생산 라인과 제품 유형을 포함하는 대표 샘플을 추출하고, 공정 변수·품질 검사 결과·환경 조건의 상관관계를 분석하며, 센서 데이터를 필터링하고 시계열로 변환해 공정 단계별 품질 지표를 만든 뒤 다변량 분석·이상 탐지 알고리즘·의사결정트리 모델을 구축해 불량률 감소 효과, 조기 경고 정확도, 비용 절감 효과를 평가한다.

분산 환경·AutoML·MLOps를 향한 진화

분산 컴퓨팅 환경에서의 SEMMA 적용, 자동화된 머신러닝(AutoML)과의 통합, 모델 해석성과 투명성을 높이는 설명 가능한 AI, MLOps 개념을 수용한 배포·모니터링 강화, 스트리밍 데이터 처리와 실시간 의사결정 지원 방법론 강화가 SEMMA가 진화하는 방향이다. 데이터 샘플링부터 모델 평가까지 핵심 데이터 마이닝 프로세스를 명확하게 구조화했다는 점에서, 특히 SAS Enterprise Miner를 쓰는 환경에서는 소프트웨어와 방법론의 밀접한 통합이 계속 효율성을 만들어낼 것으로 보인다.

SEMMASAS데이터마이닝탐색적데이터분석피처엔지니어링