연속규칙으로 시간 순서의 행동 패턴 분석하기

연속규칙의 개념과 순차패턴 마이닝 알고리즘, 시간 제약, 다차원 분석을 활용한 추천·경보·운영 적용 방식을 정리한다.

2026-08-14 · 최초 발행 2025-10-14

연속규칙은 이벤트가 함께 나타났는지가 아니라 어떤 순서로 이어졌는지를 분석한다. 연관규칙에 시간 흐름을 더해 X가 발생한 뒤 Y가 뒤따를 가능성을 표현하며, 순차패턴 마이닝과 다차원 분석을 함께 적용하면 고객 범주, 채널, 지역 같은 맥락까지 규칙에 반영할 수 있다.

시간 제약을 가진 규칙으로 행동 순서를 해석한다

연속규칙은 순서 제약을 갖는 X→Y 형태의 규칙이다. X가 발생한 뒤 일정 시간 안에 Y가 나타날 가능성을 수치로 다루며, 지지도(support), 신뢰도(confidence), 향상도(lift)를 주요 평가 지표로 사용한다.

순차패턴은 자주 나타나는 순서열 자체를 찾아낸다. 연속규칙은 이 순서열을 X→Y 규칙으로 바꿔 예측이나 추천에 바로 사용할 수 있게 한다.

시간의 범위를 어떻게 잡는지도 결과에 직접 영향을 준다. max-gap 같은 시간 간격 제약, sliding window, 에피소드 또는 세션 분할을 적용해 무관한 이벤트를 줄이고 업무 맥락에 맞는 패턴을 남긴다.

이벤트 로그를 규칙 탐색 가능한 형태로 준비한다

분석의 출발점은 엔티티와 시간의 정의다. 고객, 디바이스, 세션 같은 엔티티를 정하고 타임스탬프와 아이템 또는 행동 코드를 일관되게 기록해야 한다.

ID별로 이벤트를 시간순으로 정렬한 뒤 비정상 타임스탬프를 보정하고 중복 이벤트를 제거한다. 고객 등급, 채널, 지역, 상품군 같은 속성은 다차원 키로 결합해 세그먼트별 규칙을 탐색할 수 있다.

결과를 걸러낼 때는 지지도·신뢰도·향상도뿐 아니라 시간 제약과 최소 길이·최대 길이 제약을 함께 사용한다. Closed 패턴이나 Maximal 패턴을 선택하면 포함 관계가 많은 결과를 줄일 수 있다.

운영 환경에서는 min_support, min_confidence, max_gap, session_timeout을 조정하고, 결측·중복·시간 불일치를 처리한 내역을 품질 로그로 남긴다. 생성된 규칙은 버전 관리하고, 오프라인 평가와 A/B 후보군 검토를 거쳐 온라인 서빙 규칙 엔진과 연결한다.

탐색 방식은 데이터 규모와 제약 조건에 맞춘다

AprioriAll, AprioriSome, DynamicSome, GSP(Generalized Sequential Patterns)는 후보를 생성하고 검정하는 계열이다. AprioriAll은 소규모 데이터에서 다루기 쉽지만 다중 스캔 부담이 있으며, AprioriSome과 DynamicSome은 후보 수를 줄이는 방식으로 이를 개선한다. GSP는 패턴 제약 지원이 강하고 구현과 튜닝이 비교적 용이하다.

FreeSpan과 PrefixSpan은 투영 DB를 바탕으로 패턴을 확장하는 Pattern-Growth 계열이다. 스캔 횟수를 줄일 수 있어 대규모 데이터에 적합하다. 특히 PrefixSpan은 투영 DB 기반 탐색으로 대~초대 규모에 대응하며 라이브러리 선택지도 풍부하다.

최근에는 순차패턴에 다차원 속성을 결합하고 Spark 같은 분산 처리 환경에서 실행하거나, 제약 기반·Top-k·고유틸리티(utility) 방식으로 확장하는 흐름이 이어지고 있다.

알고리즘 성능 확장성 일관성 안정성 운영 편의
AprioriAll 소규모 양호, 다중 스캔 부담 중간 결과 재현 용이 검증 용이 구현 단순
AprioriSome/DynamicSome 후보 감소로 개선 중간 후보 선택 영향 안정적 파라미터 다소 복잡
GSP 패턴 제약 지원 우수 중간~대 일관성 높음 산업계 활용 다수 구현/튜닝 용이
FreeSpan 스캔 감소로 고성능 데이터 특성 민감 메모리 관리 중요 구현 보통
PrefixSpan 투영 DB로 최고 수준 대~초대 재현성 우수 대용량에 안정 라이브러리 풍부

중대규모 데이터라면 PrefixSpan을 우선 검토할 수 있다. 강한 제약 조건이 필요하거나 규칙 해석을 중시하는 환경에서는 GSP가 선택지가 된다.

추천·경보·품질 관리에 순서 정보를 연결한다

리테일에서는 장바구니의 구매 순서를 활용해 A 구매 후 7일 내 B 구매 같은 규칙을 만들고, 시차형 쿠폰의 발송 시점을 조정할 수 있다. 신규 고객과 충성 고객처럼 세그먼트에 따라 서로 다른 규칙을 적용하는 방식도 가능하다.

통신 서비스에서는 요금제 변경 → 고객센터 접촉 → 데이터 초과와 같은 순차패턴을 이탈 위험 신호로 사용한다. Gap 제약을 두면 단기 이상행동에 집중할 수 있다.

디지털 채널에서는 홈 → 카테고리 → 상품상세 다음에 장바구니로 이어지도록 CTA 배치를 조정할 수 있다. PrefixSpan 기반 세션 패턴은 개인화 추천 정책을 만드는 데 활용된다.

제조·품질 영역에서는 온도 스파이크 → 진동 증가 → 불량 순서의 규칙으로 예방정비 일정을 설계하고, 설비와 라인 차원을 함께 분석한다. 헬스케어에서는 증상 A → 검사 B → 처방 C 같은 규칙을 바탕으로 케어패스를 분석하며 연령과 합병증에 따른 환자군별 경로를 구분할 수 있다.

로그에서 서빙 가능한 규칙까지 이어지는 흐름

입력에는 엔티티ID, 타임스탬프, 아이템코드를 포함한 이벤트 로그와 고객·채널·지역 차원 테이블, min_support, max_gap 등의 파라미터가 포함된다.

처리 과정에서는 정렬과 세션화 후 빈발 항목 및 시퀀스를 추출하고, 시간 제약과 다차원 결합을 적용한 뒤 X→Y 규칙을 평가한다. 시간 역전 이벤트는 삭제하고, 중복 이벤트는 압축하며, 비정상 세션은 분리한다.

출력물은 순차패턴 목록, support·confidence·lift를 포함한 연속규칙, 차원별 규칙 대시보드, 그리고 서빙 가능한 규칙 카탈로그다.

AprioriAll과 GSP 기준의 탐색 흐름은 정렬, 빈발 항목집합 산출, 거래 DB 변환, 빈발 시퀀스 탐색, 최대 시퀀스 선택으로 이어진다. Large Itemset 단계는 탐색 공간을 줄이고, Maximal 단계는 부분시퀀스에 포함되지 않는 최대 시퀀스만 남겨 결과를 압축한다.

예외처리제약입력: 이벤트 로그, 차원테이블, 파라미터Sort/세션화ID별 시간 정렬Large Itemset빈발 항목집합 추출Transformation빈발항목 기반 DB 투영/압축Sequence Mining빈발 시퀀스 탐색Maximal/Closed 선택결과 축약규칙 생성 X→Ysupport/confidence/lift다차원 결합/세그먼트별 규칙출력: 추천/캠페인/경보시간 역전/중복/결측 보정max-gap, window, length

차원 정보를 붙여 규칙의 적용 범위를 구분한다

이벤트에 고객 등급, 채널, 지역 같은 차원 키를 붙이면 세그먼트별로 패턴을 마이닝할 수 있다. 프리미엄 고객처럼 특정 범주에서만 규칙을 찾거나, 차원에 따라 min_support를 다르게 적용하는 방법도 있다.

상품 카테고리의 상·중·하 계층처럼 계층형 속성을 사용하면 레벨별 패턴을 함께 채굴할 수 있다. 저장 계층은 ID와 시간을 기준으로 파티셔닝한 컬럼 지향 DWH 또는 데이터레이크로 구성하고, 처리 계층에서는 Spark와 SPMF·MLlib·Custom 구현을 조합한다. 서빙 계층은 규칙 카탈로그, 피쳐스토어, 실시간 룰 엔진 또는 추천 시스템으로 연결한다.

적용 범위와 운영 기준을 먼저 합의한다

시차형 추천과 프로모션을 최적화하면 전환율 515%p 개선 가능성이 있으며, 위험 시퀀스를 조기에 탐지하면 이탈률 310% 상대 개선 가능성이 있다. 불필요한 캠페인을 줄이고 타이밍을 정밀하게 조정하면 마케팅 비용 10~30% 절감 가능성도 있다. 규칙 기반 결과는 해석이 가능하므로 규제와 감사 대응에도 활용할 수 있다.

도입 전에는 예측·추천·경보 가운데 1차 목적을 합의한다. 이어 이벤트 정의와 세션 구조를 정하고 session_timeout, max_gap을 확정한다. 데이터 규모가 크면 PrefixSpan을, 제약과 해석을 강조하면 GSP를 검토하며, min_supportmin_confidence는 그리드 탐색으로 조정해 과적합을 방지한다.

운영 단계에서는 규칙 버전 관리, 모니터링, 정기 재학습 주기, A/B 검증 체계를 함께 설계한다. 시간 흐름에 내재된 행동 인과를 포착하는 연속규칙은 예측 가능성과 의사결정 품질을 높이는 분석 기반이 될 수 있다.

연속규칙순차패턴 마이닝데이터 마이닝PrefixSpanGSP