데이터베이스·빅데이터
DB 이론·설계, 빅데이터 처리, 데이터 엔지니어링
326 POSTS · 7 / 11
LDM(Local Dynamic Map): 자율주행이 참조하는 4계층 공간 데이터베이스
정밀전자지도와 V2X 동적 객체를 4개 계층·TTL 기반으로 융합하는 LDM의 데이터 모델·서비스·품질 관리 구조를 정리한다
2025-12-09
ISO/IEC 11179가 실제로 규정하는 것 — 파트 구성과 명명·정의 규칙
ISO/IEC 11179 표준의 Part 1~6 구성, 명명·식별 원칙, 정의 품질 규칙, 분류체계와 도구 선택 스펙트럼을 정리한다.
2025-12-03
LOD를 어디에 담을 것인가 — 트리플스토어·프로퍼티그래프·정적 덤프 비교
링크드 오픈 데이터(LOD)를 트리플스토어·프로퍼티그래프·정적 덤프 중 어디에 담고 서빙할지 성능·확장성·운영 관점에서 비교하고, 바이오·의료 지식그래프 사례를 짚는다.
2025-12-03
ISO 11179, 데이터 요소의 의미를 표준화하는 메타데이터 레지스트리
ISO/IEC 11179 메타데이터 레지스트리의 DEC/Value Domain 구조와 등록 상태 관리, 품질·거버넌스 워크플로를 실무 적용 사례와 함께 정리한다.
2025-11-26
지식표현: 논리·규칙·확률·그래프·임베딩을 언제 섞는가
논리·그래프·규칙·확률·임베딩 기반 지식표현 방법을 운영 특성으로 비교하고, 하이브리드 추론 파이프라인과 Prolog·RDF 코드 예시로 실무 적용 지점을 정리한다.
2025-11-26
링크드데이터: URI로 식별하고 RDF로 연결하는 데이터 모델
URI로 리소스를 식별하고 RDF로 의미적 링크를 구성하는 링크드데이터 4원칙과 URI 설계, 어휘 재사용, 트리플스토어 구현 방법을 정리한다.
2025-11-26
링크드 오픈 데이터(LOD) 구현: SHACL 검증과 링크셋 매칭 아키텍처
링크드데이터 원칙과 오픈 라이선스를 결합한 LOD의 URI 설계, SHACL 검증, 링크셋 매칭, SPARQL 엔드포인트 배포 절차를 실무 관점에서 정리한다.
2025-11-26
JSON 데이터 교환 형식과 검증 파이프라인
JSON의 데이터 모델과 직렬화·역직렬화 과정, 스키마 검증, API·이벤트·설정 관리에서의 운영 원칙을 정리한다.
2025-10-14
Kafka·Spark·Flink으로 설계하는 실시간 ETL 파이프라인
Apache Kafka, Spark Structured Streaming, Apache Flink를 조합해 실시간 ETL 파이프라인의 정확성, 상태 관리, 운영 기준을 정리한다.
2025-10-14
데이터 레이크하우스에서 Delta Lake·Iceberg·Databricks를 선택하는 기준
데이터 레이크하우스의 테이블 포맷, 카탈로그, 컴퓨트 계층을 기준으로 Delta Lake·Apache Iceberg·Databricks의 운영 전략과 선택 기준을 정리한다.
2025-10-14
Lambda·Kappa·Data Mesh로 설계하는 대규모 데이터 플랫폼
Lambda Architecture, Kappa Architecture, Data Mesh 원칙을 비교하고 스트림·배치 처리, 거버넌스, 운영 설계 기준을 정리한다.
2025-10-14
레거시 데이터를 클라우드로 옮길 때 설계해야 할 마이그레이션 체계
레거시 시스템의 클라우드 데이터 마이그레이션에서 CDC, 스키마 진화, 데이터 라인리지를 설계하고 운영하는 방법을 정리합니다.
2025-10-14
MMDB로 설계하는 메모리 기반 초고속 데이터 처리
MMDB의 메모리 기반 저장 구조, 로그와 스냅샷을 통한 지속성, 디스크 DBMS와의 차이와 적용 환경을 정리한다.
2025-10-14
MapReduce로 대용량 배치 처리를 설계하는 방법
MapReduce의 맵·셔플·리듀스 처리 구조와 HDFS 데이터 지역성, 장애 복구, Hadoop Streaming 운영 조건을 정리한다.
2025-10-14
Microsoft Fabric 커넥터로 데이터 소스 연동을 표준화하는 방법
Microsoft Fabric 커넥터의 인증, 증분 적재, 스키마 관리, 재시도와 관측성을 통해 데이터 파이프라인 연동을 표준화하는 방법
2025-10-14
결측치 처리와 이상치 탐지로 데이터 전처리 파이프라인 설계하기
결측치 삭제·보간·KNN Imputation과 Z-점수·IQR·DBSCAN 이상치 탐지 방식을 데이터 전처리 파이프라인 관점에서 정리한다.
2025-10-14
모바일 DB 선택과 오프라인 동기화 설계
모바일 DB의 로컬 저장, 오프라인 처리, 서버 동기화 구조와 SQLite·Realm·ObjectBox·Couchbase Lite 선택 기준을 정리한다.
2025-10-14
MongoDB 문서 모델과 분산 운영 설계
MongoDB의 BSON 문서 모델, 복제셋과 샤딩 아키텍처, 인덱스·트랜잭션·GridFS 설계와 운영 최적화 기준을 다룬다.
2025-10-14
JDBC Statement와 PreparedStatement: SQL 실행 방식 선택
JDBC의 Statement와 PreparedStatement 처리 흐름, SQL 인젝션 위험, 반복 실행과 배치 처리 시 선택 기준을 정리한다.
2025-08-10
Linked Data로 연결하는 시맨틱 웹과 지식 그래프
Linked Data의 URI, RDF, SPARQL 기반 구조와 구현 원칙, 지식 그래프·공공데이터·기업 시스템 활용 방식을 정리한다.
2025-08-10
논리 모델링으로 데이터 구조를 정제하는 방법
논리 모델링에서 엔티티, 식별자, 관계, 정규화와 CRUD 매트릭스를 정리해 데이터베이스 구조를 설계하는 방법
2025-08-10
MDM으로 분산된 기업 마스터 데이터를 일관되게 관리하는 법
MDM의 역할과 아키텍처, 구현 스타일, 데이터 거버넌스 연계 방식을 통해 기업 마스터 데이터 관리 체계를 정리한다.
2025-08-10
MongoDB 문서 모델과 분산 구조를 설계하는 방법
MongoDB의 BSON 문서 모델, 복제셋과 샤딩 구조, 데이터 모델링과 인덱스 최적화, 보안·백업 운영 방식을 정리한다.
2025-08-10
ISO/IEC 20547: 빅데이터 참조 아키텍처를 국제 표준으로 다루는 법
ISO/IEC 20547의 파트 구성과 참조 아키텍처 역할·기능 구성요소, 보안·프라이버시 규정, 금융·의료 적용 사례와 관련 표준 연계를 정리한다.
2025-05-23
카파 아키텍처: 배치 계층 없이 스트림 하나로 처리하기
람다 아키텍처의 배치 계층을 없애고 단일 스트림 파이프라인으로 실시간 처리와 재처리를 모두 감당하는 카파 아키텍처의 구조와 트레이드오프를 정리한다.
2025-05-23
람다 아키텍처: 배치와 스트림을 나란히 돌리는 이유
배치 레이어와 스피드 레이어를 병행해 정확성과 속도를 동시에 확보하는 람다 아키텍처의 구조와 코드 중복이라는 대가, 카파·델타 같은 대안을 정리한다.
2025-05-23
맵리듀스: 맵과 리듀스로 나눠 대용량 데이터를 처리하는 법
구글이 2004년 발표한 맵리듀스의 맵-셔플-리듀스 처리 모델과 하둡 구현 구조, 워드 카운트 예제와 활용 사례, 한계를 정리한다.
2025-05-23
Kafka와 Beam으로 설계하는 실시간 이벤트 처리 아키텍처
Apache Kafka 이벤트 백본과 Apache Beam 통합 처리 모델을 결합해 실시간 스트리밍 파이프라인을 설계하고 운영하는 방법을 정리합니다.
2024-04-29
MapReduce와 Spark RDD로 설계하는 분산 병렬 데이터 처리
MapReduce와 Spark RDD의 실행 모델, 셔플과 파티셔닝, 장애 복구 및 분산 병렬 처리 튜닝 방식을 실무 관점에서 정리한다.
2024-04-29
마코프 체인과 멀티터치 기여도 분석 운영
마코프 체인 기반 멀티터치 기여도 분석의 경로 모델링, 제거 효과, 검증 체계와 예산 재배분 활용 방식을 정리한다.
2024-04-29