데이터 마이닝에서 연관규칙·시퀀스 패턴·텍스트 분석을 운영하는 법

Apriori·FP-Growth·SPADE·텍스트 마이닝의 처리 방식과 평가 지표, 데이터 품질 관리 및 운영 적용 방식을 정리합니다.

2026-08-14 · 최초 발행 2025-10-14

거래·이벤트·텍스트에서 서로 다른 패턴을 꺼내는 방법

데이터 마이닝은 구조화·비구조화 데이터에서 통계와 알고리즘을 이용해 의미 있는 패턴을 찾는 과정이다. 특징 공학, 모델링, 평가, 배포가 하나의 파이프라인으로 이어진다.

거래 데이터에서는 아이템이 함께 등장하는 관계를 X→Y 형태로 찾는 연관규칙을 사용한다. 이때 Support, Confidence, Lift가 핵심 지표가 된다. 시간 순서가 있는 이벤트 로그는 빈발 시퀀스를 찾는 대상이며, SPADE는 수직 형식인 id-list와 교집합 연산으로 패턴을 확장한다.

텍스트 마이닝은 자연어에서 분류, 토픽, 감성, 키워드 등의 정보를 추출한다. 전처리 뒤 BoW, TF-IDF, Embedding 같은 표현 학습을 적용하고 학습·추론 경로를 구성한다.

분석 전에 데이터 품질과 식별 체계를 먼저 맞춘다

스키마를 표준화하고 결측치·이상치·중복을 정리한 뒤, 시계열 데이터는 시간 순서를 맞춰야 한다. 텍스트는 언어 식별, 토큰화, 표제어 추출, 도메인 사전 적용이 필요하다.

거래와 이벤트 로그는 세션화, 시간 버킷팅, 아이템·이벤트 코딩 기준을 함께 설계한다. GDPR·개인정보 마스킹과 데이터 거버넌스도 이 단계에서 적용 범위가 정해진다.

후보 생성 방식과 수직 형식의 차이

Apriori는 부분집합 폐쇄 성질을 이용해 후보를 생성하고 검증하는 과정을 반복한다. 고차원·희소 데이터에서는 후보가 급격히 늘어날 수 있다.

FP-Growth는 FP-트리로 데이터를 압축한 다음 패턴 분기를 탐색한다. 메모리 안에 트리를 만드는 비용이 있지만 탐색 효율은 우수하다.

SPADE는 각 패턴이 발생한 위치 집합을 id-list로 관리한다. 패턴 확장은 교집합 연산으로 수행하며, 최소·최대 간격, 윈도우, 길이 같은 제약을 적용해 잡음을 줄이고 실행 시간을 단축할 수 있다.

텍스트 파이프라인에서는 정규화, 불용어 제거, 토큰화, 형태소 분석 또는 SentencePiece를 적용한다. 도메인 용어 사전과 룰 기반 정제를 함께 둘 수 있다. 표현은 TF-IDF·n-gram, Word2Vec/FastText, Transformer 임베딩 가운데 선택하며, 과적합과 편향을 줄이기 위한 사전 학습·미세조정 전략이 뒤따른다.

결과를 배포 가능한 규칙과 모델로 검증한다

연관규칙과 시퀀스 패턴은 Support, Confidence, Lift, Conviction 등의 지표를 함께 보고 spurious rule을 걸러야 한다. 비즈니스 검증 워크플로우도 분석 결과에 포함된다.

운영 환경에서는 룰 엔진, 실시간 피드, 대시보드로 결과를 배포하고 버전 관리, 재학습 스케줄러, 규칙 유효율과 드리프트 지표를 운용한다. 해석 가능성과 감사 추적성은 이 단계에서 확보한다.

이산 거래시간 순서 이벤트자유 텍스트미달충족미달충족오류정상미달충족입력: 거래·이벤트 로그, 자유텍스트전처리: 정제/정규화/토큰화알고리즘 선택Apriori / FP-GrowthSPADEText Pipelineminsup/metric 설정 검토간격·길이 제약 검토언어/인코딩 검증파라미터 상향/샘플 축소출력: 규칙 X→Y제약 재설정/세션화 재정의출력: 시퀀스 ⟨A,B,...⟩재토큰화/사전 교체출력: 토픽/분류/감성평가:Support/Confidence/Lift평가: Support/Gap/Length평가: Accuracy/F1/AUC임계 충족?재학습: 파라미터·특징 조정배포: 룰엔진/추천/대시보드

데이터 유형별 알고리즘 선택 기준

항목 Apriori FP-Growth SPADE Text Mining(Pipeline)
성능 후보 생성·검증 비용 높음, 디스크 I/O 민감 FP-트리 압축으로 고속 탐색 id-list 교집합 기반 고속 전처리·임베딩 비용 지배
확장성 분산화 난이도 보통 분산 FP-트리 구현 난이도 높음 수직 형식 분산 처리 용이 분산 벡터화·배치 추론로 확장
일관성 임계 동일 시 결정적 결과 동일 동일 난수 초기화·샘플링 관리 필요
안정성 잡음·희소도에 취약 비교적 강건 제약 설정에 민감 도메인·언어 편향에 민감
운영 편의 규칙 해석 용이 규칙 해석 용이 시퀀스 해석 난이도 중간 모델·토큰화·사전 동기화 필요

코드로 확인하는 분석 경로

전제조건: Python 3.10, mlxtend>=0.23, scikit-learn>=1.3, Java 11+, SPMF 2.60+

연관규칙은 one-hot 인코딩된 장바구니 데이터를 대상으로 Apriori와 Lift 기준 규칙 추출을 적용할 수 있다.

# pip install mlxtend pandas
import pandas as pd
from mlxtend.frequent_patterns import apriori, association_rules

# 장바구니 데이터 one-hot 인코딩 가정
df = pd.DataFrame({
    'milk':[1,1,0,1], 'bread':[1,0,1,1], 'butter':[0,1,1,1], 'eggs':[0,1,0,1]
})
freq = apriori(df, min_support=0.5, use_colnames=True)
rules = association_rules(freq, metric='lift', min_threshold=1.1)
print(rules[['antecedents','consequents','support','confidence','lift']])

SPADE는 SPMF를 통해 시퀀스 입력을 처리할 수 있다.

# 다운로드: http://www.philippe-fournier-viger.com/spmf/
java -Xmx4g -jar spmf.jar run SPADE input.txt output.txt 50%
# input.txt 형식 예: <(1, 1) (3, 1)> -1 <(1, 2)> -1 -2  # 시퀀스와 트랜잭션 ID 인코딩

텍스트 분류에서는 TF-IDF 표현과 로지스틱 회귀를 하나의 파이프라인으로 묶어 F1을 확인할 수 있다.

# pip install scikit-learn
from sklearn.model_selection import train_test_split
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import Pipeline
from sklearn.metrics import f1_score

X = ["배송이 빠름", "포장 불량", "친절한 상담", "지연 발생"]
y = [1, 0, 1, 0]  # 1: 긍정, 0: 부정
pipe = Pipeline([("tfidf", TfidfVectorizer(ngram_range=(1,2))),
                 ("clf", LogisticRegression(max_iter=1000))])
X_tr, X_te, y_tr, y_te = train_test_split(X, y, test_size=0.5, random_state=42, stratify=y)
pipe.fit(X_tr, y_tr)
pred = pipe.predict(X_te)
print("F1:", f1_score(y_te, pred))

룰·시퀀스·텍스트 분석을 운영에 연결하는 장면

리테일 장바구니 분석에서는 크로스셀, 번들링, 진열 최적화에 쓸 규칙을 도출하고 Lift 기준 상위 규칙을 A/B 테스트에 적용할 수 있다. 추천과 캠페인 자동화에서는 연관규칙을 룰 엔진에 넣고 재고·마진 제약과 결합하며, 룰 버전과 유효기간을 관리한다.

고객 여정과 프로세스 마이닝에서는 SPADE로 이벤트 로그의 이탈 시퀀스와 병목을 찾고 SLA 위반 패턴 알림을 개선 액션에 연결한다. VOC·소셜 모니터링은 텍스트 마이닝으로 이슈 토픽을 감지하고 감성을 추적하며, 키워드 트렌드를 CS 인입량 예측과 연동한다.

교차판매 전환율은 38%p 상승하고 장바구니 단가는 25% 증가하며, 콜 감축은 1020% 달성이 가능하다. 프로세스 리드타임은 515% 단축될 수 있다. 해석 가능한 규칙을 바탕으로 의사결정을 강화하고 운영 투명성·감사 추적성을 확보하며 데이터 거버넌스 성숙도를 높일 수 있다.

연관규칙, 시퀀스 패턴, 텍스트 마이닝은 데이터 품질 관리와 적절한 제약·임계 설정, 다중 지표 평가, 배포·모니터링을 함께 적용할 때 운영 가치가 생긴다. 모델 선택은 비즈니스 제약과 해석 가능성을 기준으로 하고, 적용 범위는 점진적으로 넓힌다.

데이터 마이닝연관규칙시퀀스 패턴텍스트 마이닝SPADE