데이터베이스·빅데이터
DB 이론·설계, 빅데이터 처리, 데이터 엔지니어링
326 POSTS · 1 / 11
주제 지도
데이터베이스71
데이터 거버넌스35
데이터 모델링24
트랜잭션22
정규화22
데이터베이스 설계21
빅데이터20
데이터거버넌스16
전체 글
Apache Spark 4.0에서 Spark Connect로 통합하는 ML·AI 워크로드
Apache Spark 4.0의 Spark Connect, TorchDistributor, 분산 딥러닝과 배치·스트리밍·ML 통합 아키텍처를 정리한다.
2026-05-05
Advanced Analytics로 실시간 의사결정 체계 설계하기
Advanced Analytics의 실시간·컨텍스트·예측 분석 구조와 스트리밍 처리, 모델 운영, 도입 시 설계 트레이드오프를 정리한다.
2025-10-14
지오스파셜·네트워크·D3 애니메이션으로 맥락을 읽는 데이터 시각화
지리 좌표, 관계 데이터, 시간 변화가 얽힌 데이터를 지오스파셜 시각화·네트워크 그래프·D3 애니메이션으로 분석하는 설계와 렌더링 선택 기준
2025-10-14
Apache Beam·Flink·Hive QL·Presto로 데이터 처리 경로 설계하기
Apache Beam, Flink, Hive QL, Presto(Trino)의 처리 모델과 일관성, 카탈로그 운영 방식을 비교해 데이터 플랫폼의 역할을 설계한다.
2025-10-14
연관규칙으로 거래 데이터의 동시 발생 패턴 찾기
연관규칙의 지지도·신뢰도·향상도와 Apriori, FP-Growth, Eclat 선택 기준을 정리한 데이터 마이닝 실무 가이드
2025-10-14
AWS EMR·Dataflow·Synapse로 데이터 처리 플랫폼 고르기
AWS EMR, Google Cloud Dataflow, Azure Synapse Analytics의 처리 방식과 운영 특성을 비교해 배치·스트리밍 분석 플랫폼 선택 기준을 정리한다.
2025-10-14
BI 2.0 실시간 분석과 운영 의사결정 체계
BI 2.0의 실시간 분석, BPM·BAM, SOA, 이벤트 드리븐 처리와 셀프서비스 UX를 운영 의사결정 관점에서 정리한다.
2025-10-14
빅데이터 3V·5V와 확장 가능한 처리 아키텍처
빅데이터 3V·5V 특성과 스케일 아웃, 스트리밍 처리, 데이터 품질·거버넌스 설계 원칙을 정리한다.
2025-10-14
빅데이터 아키텍처와 분산 데이터 운영 전략
빅데이터 4V 특성과 수집·저장·분석·표현 라이프사이클을 기반으로 분산 데이터 플랫폼의 구성과 운영 원칙을 정리한다.
2025-10-14
빅데이터 윤리 운영: 편향 감사와 책임 있는 데이터 활용
빅데이터 윤리 체계에서 편향 감사, 윤리적 AI 가이드라인, 책임 있는 데이터 활용을 운영 프로세스와 통제 지표 중심으로 정리한다.
2025-10-14
빅데이터 처리 파이프라인: 수집부터 스트림 분석·저장·시각화까지
Flume, Sqoop, Kafka, Spark, Storm, HDFS, Hive를 연결해 빅데이터 수집·처리·저장·분석 파이프라인을 운영하는 구조와 구현 예시
2025-10-14
BI로 데이터 흐름과 의사결정 체계 연결하기
BI의 데이터 수집·통합·분석·시각화 구조와 시맨틱 레이어, 데이터 웨어하우스, 거버넌스 기반의 의사결정 지원 방식을 정리한다.
2025-10-14
Power BI KPI 대시보드와 DAX·NLQ로 BI 의미 계층 설계하기
KPI 대시보드, Power BI DAX, 자연어 질의를 연결해 의미 계층과 데이터 거버넌스를 갖춘 BI 의사결정 체계를 설계하는 방법
2025-10-14
CAP 이론으로 분산 데이터베이스 선택 기준 잡기
CAP 이론의 일관성·가용성·분할 내성 트레이드오프를 바탕으로 분산 데이터베이스 설계와 DBMS 선택 기준을 정리한다.
2025-10-14
PSM·DiD·도구 변수로 관찰 데이터의 인과효과 추정하기
관찰 데이터에서 정책과 제품 변경의 효과를 추정할 때 PSM, DiD, 도구 변수의 가정·진단·활용 방식을 정리한다.
2025-10-14
ACID와 BASE, 데이터 일관성과 가용성 사이의 설계 선택
ACID와 BASE의 트랜잭션 특성, 일관성·가용성·확장성의 차이, 데이터베이스 설계 시 선택 기준을 정리합니다.
2025-08-10
암스트롱 공리로 함수적 종속성을 추론하는 방법
암스트롱 공리의 기본·추가 추론 규칙과 함수적 종속성 폐포를 바탕으로 후보키 식별, 정규화, 스키마 분해에 적용하는 방법
2025-08-10
B-Tree 인덱스의 구조와 데이터베이스 설계 전략
B-Tree와 B+Tree 구조, 검색 특성, 복합·커버링 인덱스 설계와 DBMS별 운영 차이를 정리한다.
2025-08-10
빅데이터큐레이션으로 실시간 경영 인사이트 만드는 방법
빅데이터큐레이션의 데이터 수집, 선별, 인사이트 전달 구조와 유통·제조·금융 활용 사례, 도입 시 고려할 운영 요소를 정리한다.
2025-08-10
빅데이터 5V와 데이터 처리 아키텍처
빅데이터의 3V·5V 특성과 수집·저장·처리·분석·시각화 아키텍처, 산업별 활용과 운영 과제를 정리한다.
2025-08-10
AI 학습 데이터 품질관리: 정확성부터 적시성까지 품질 차원과 관리 체계
AI 학습용 데이터의 품질 차원, 품질관리 생애주기·조직·메트릭, 개선 기법, 산업별 사례와 편향·프라이버시 등 도전과제를 정리한다.
2025-05-23
BASE 모델: CAP에서 가용성을 택한 자리에 남는 일관성 문제
분산 시스템이 CAP 이론에서 가용성을 우선했을 때 데이터 일관성을 다루는 BASE 모델의 구성 요소, ACID와의 차이, 구현 전략과 실제 활용 사례를 정리한다.
2025-05-23
빅데이터, 볼륨보다 5V 전체로 봐야 하는 이유
빅데이터의 5V 특성과 수집·저장·처리 아키텍처, 분석 기법을 정리하고 소매·금융·의료·공공 영역의 실제 활용 사례를 짚는다.
2025-05-23
빅데이터 분석 방법론 선택과 실행 프로세스
CRISP-DM·SEMMA·KDD 등 빅데이터 분석 방법론을 선택 기준으로 비교하고, 문제 정의부터 배포·모니터링까지 이어지는 실행 프로세스를 단계별로 정리한다.
2025-05-23
빅데이터 요소기술: 수집·저장·처리·분석 도구 총정리
Kafka·HDFS·Spark부터 데이터 거버넌스·보안 도구, Lambda·Kappa·Data Mesh 아키텍처 패턴까지 빅데이터를 구성하는 핵심 요소기술을 정리한다.
2025-05-23
빅데이터 플랫폼, 계층보다 먼저 정할 것은 유형이다
빅데이터 플랫폼의 정의와 계층형 아키텍처, 하둡·스파크·클라우드 네이티브 유형별 구축 사례, 기술·조직·보안 고려사항과 데이터 메시로 향하는 전망을 정리한다.
2025-05-23
빅데이터 참조 아키텍처: NIST·IBM·Azure 모델과 계층 구조
NIST·IBM·Azure의 빅데이터 참조 아키텍처 모델과 수집·저장·처리·분석·시각화 5계층 구조, 산업별 설계 사례와 고려사항을 정리한다.
2025-05-23
CAP 이론: 분산 시스템이 동시에 가질 수 없는 것들
일관성·가용성·분할 내성을 동시에 만족할 수 없다는 CAP 이론의 트레이드오프와 CP·AP 시스템 설계 전략, PACELC 확장 모델을 정리한다.
2025-05-23
Tableau·Power BI·QlikView BI 설계와 성능 최적화
Tableau, Power BI DAX, QlikView를 중심으로 데이터 모델링, 계산 계층, 대시보드 배포와 거버넌스 설계 기준을 정리한다.
2024-04-29
BI KPI 대시보드 설계와 드릴다운·What-If 분석 운영
BI 환경에서 KPI 대시보드, 드릴다운 분석, What-If 시나리오를 시맨틱 모델과 데이터 품질 체계 위에 설계·운영하는 방법을 정리한다.
2024-04-29