데이터베이스·빅데이터
DB 이론·설계, 빅데이터 처리, 데이터 엔지니어링
326 POSTS · 2 / 11
찾을 수 없는 데이터는 없는 데이터다 — 데이터 카탈로그 구축과 도구 선택
메타데이터 수집부터 검색·용어집·품질 프로파일링까지 데이터 카탈로그의 구조를 정리하고, 90일 도입 로드맵과 DataHub·Atlas·Collibra 등 도구 선택 기준을 비교한다
2025-12-09
데이터 패브릭, 흩어진 저장소를 옮기지 않고 하나로 묶는 법
활성 메타데이터·데이터 가상화·카탈로그·거버넌스를 결합해 웨어하우스·레이크·스트림·SaaS를 하나의 논리 계층으로 연결하는 데이터 패브릭 개념과 아키텍처를 정리한다
2025-12-09
ETL이냐 CDC냐 가상화냐 — 데이터 통합 패턴을 상황별로 고르는 법
ETL/ELT 선택, CDC 스트리밍, 데이터 가상화, 다중 존 레이크하우스, 정책 중심 접근, 액티브 메타데이터 오케스트레이션까지 여섯 가지 데이터 통합 디자인 패턴과 CDC 구현 예시를 정리한다
2025-12-09
데이터 레이크, 스키마는 나중에 정해도 되는 이유
오브젝트 스토리지·스키마 온 리드·Delta/Iceberg/Hudi 테이블 레이어로 원본 데이터를 그대로 보존하며 ML·BI를 함께 지원하는 데이터 레이크 아키텍처를 정리한다
2025-12-09
중앙 데이터팀이 병목이 됐을 때 — 데이터 메시라는 조직 재설계
도메인 소유권·데이터 제품화·셀프서브 플랫폼·연합 거버넌스 네 원칙으로 구성된 데이터 메시의 구조와 도입 로드맵, 산업별 적용 사례를 정리한다
2025-12-09
CDC로 설계하는 실시간 데이터 변경 전파 파이프라인
CDC(Change Data Capture)의 변경 포착 방식과 Push·Pull 전송 모델, 정합성·멱등성·스키마 진화까지 실시간 데이터 파이프라인 설계 관점에서 정리한다.
2025-10-14
클라우드 데이터 웨어하우스와 데이터 마트 설계
Snowflake, Redshift, BigQuery의 특성과 데이터 마트 설계 원칙, ELT 파이프라인·거버넌스·비용 운영 기준을 정리합니다.
2025-10-14
군집 분석에서 K-평균·계층적 군집·DBSCAN을 고르는 기준
K-평균, 계층적 군집, DBSCAN의 특성과 실루엣 계수·엘보우 방법을 활용한 군집 모델 선택 전략을 정리한다.
2025-10-14
상관 분석 실무: Pearson·Spearman·Kendall tau 선택과 상관 행렬 활용
Pearson, Spearman, Kendall tau 상관계수의 가정과 차이를 비교하고, 전처리·유의성 검정·상관 행렬 시각화까지 정리한다.
2025-10-14
데이터 정제 파이프라인: 중복 제거와 스케일·분포 변환 운영법
중복 제거, 정규화·표준화, 로그·Box-Cox 변환을 데이터 품질과 머신러닝 운영 관점에서 정리한다.
2025-10-14
데이터 수집 방식별 설계 원칙과 통합 파이프라인 운영
설문조사, IoT 센서, 웹 스크래핑, API, 로그 수집을 통합하는 데이터 인입 설계와 품질·보안 운영 원칙을 정리합니다.
2025-10-14
Data Fabric으로 분산 데이터 자산을 통합 제어하는 방법
Data Fabric의 메타데이터, 정책, 오케스트레이션 기반 통합 제어 구조와 가상화·복제·스트리밍 운영 방식을 정리한다.
2025-10-14
Apache Atlas와 Great Expectations로 설계하는 데이터 거버넌스
Apache Atlas 메타데이터와 데이터 카탈로그, Great Expectations 품질 검증을 결합한 데이터 거버넌스 운영 체계를 정리한다.
2025-10-14
데이터 성숙도와 Analytics CoE로 설계하는 데이터 전략
데이터 성숙도 모델, Analytics CoE, ROI 분석을 연결해 데이터 거버넌스와 투자 우선순위, 가치 실현 체계를 설계하는 방법을 다룬다.
2025-10-14
Column Family 데이터베이스의 분산 저장과 모델링 방식
Column Family 데이터베이스의 저장 구조, 관계형 DB와의 차이, Cassandra·HBase 기반 모델링과 운영 고려사항을 정리한다.
2025-08-10
개념 모델링으로 업무 규칙을 데이터 구조로 옮기는 방법
개념 모델링의 엔티티·속성·관계·식별자와 접근 방법, 논리·물리 모델로 이어지는 데이터베이스 설계 흐름을 정리합니다.
2025-08-10
연결함정: ERD 관계가 끊기거나 모호해지는 이유
연결함정의 원인과 부채꼴함정·균열함정 사례를 통해 ERD 관계 모델링 오류를 점검하는 방법을 정리합니다.
2025-08-10
데이터 중복 제거로 스토리지 효율 높이기
데이터 중복 제거의 청킹 방식, 적용 위치, 라빈 핑거프린팅과 GPGPU 활용, 운영 시 고려할 무결성·암호화 이슈를 정리한다.
2025-08-10
데이터 중복 제거로 스토리지 효율을 높이는 설계
데이터 중복 제거의 처리 위치와 시점, 청킹·핑거프린팅·인덱스 설계, 성능과 보안 고려사항을 정리한다.
2025-08-10
데이터거버넌스로 데이터 자산의 책임과 통제 체계 세우기
데이터거버넌스의 원칙·조직·절차를 중심으로 데이터 품질, 접근 통제, 라이프사이클 관리 체계를 정리한다.
2025-08-10
데이터 독립성으로 데이터베이스 변경 영향을 분리하는 법
데이터 독립성의 논리적·물리적 구분과 3단계 스키마 구조, 뷰·매핑을 통한 데이터베이스 변경 영향 분리 원칙을 정리한다.
2025-08-10
데이터 독립성으로 스키마와 저장 구조의 변화를 분리하는 법
데이터 독립성의 논리적·물리적 구분과 ANSI/SPARC 스키마 매핑, 뷰·API 기반 구현 시 고려할 한계를 정리합니다.
2025-08-10
데이터 무결성을 지키는 제약조건과 검증 체계
데이터 무결성의 유형과 위협 요인을 짚고, 제약조건·트랜잭션·검증·감사 로그로 일관성을 관리하는 방법을 정리합니다.
2025-08-10
Column Family 데이터베이스: 행 키와 컬럼 패밀리로 쓰기 성능을 끌어올리는 구조
Column Family 데이터베이스가 행 키·컬럼 패밀리로 데이터를 구성하는 방식, HBase·Cassandra·ScyllaDB 비교, 데이터 모델링 원칙과 RDBMS 대비 트레이드오프를 정리한다.
2025-05-23
CEP(복합 이벤트 처리): 이벤트 상관관계에서 패턴을 읽는 법
CEP의 이벤트·패턴 개념과 캡처-처리-액션 아키텍처, 규칙·통계/ML 기반 구현 방식, 금융·통신·제조 적용 사례와 주요 엔진을 정리한다.
2025-05-23
CQL(연속 질의 언어): 스트림에 SQL 문법을 얹는 법
CQL과 SQL의 차이, 윈도우 연산·스트림 조인·패턴 매칭 문법, 금융·IoT·텔레콤 활용 사례와 Apache Flink 등 구현 플랫폼을 정리한다.
2025-05-23
CRISP-DM: 데이터 마이닝 프로젝트의 산업 표준 프로세스
1996년 유럽 컨소시엄이 만든 CRISP-DM의 단계별 구조와 반복적 특징, SEMMA·KDD 등 대안과의 관계, 산업별 적용 사례를 정리한다.
2025-05-23
데이터 분석은 즉흥이 아니라 절차다
문제 정의부터 의사결정 적용까지 이어지는 데이터 분석 프로세스 각 단계와 프로젝트 성공 요소, 실패 사례, 현대적 트렌드를 정리한다.
2025-05-23
AWS S3/EMR, BigQuery, Synapse로 설계하는 대규모 데이터 분석 아키텍처
AWS S3/EMR, Google BigQuery, Azure Synapse Analytics의 분석 구조와 성능, 비용, 거버넌스 설계 기준을 비교한다.
2024-04-29
데이터 거버넌스 설계: 메타데이터·라인에이지·GDPR 운영
메타데이터 관리와 데이터 라인에이지를 연결하고 GDPR 준수, 접근 제어, DSR 자동화를 운영 체계로 설계하는 방법을 다룬다.
2024-04-29