MLOps·데이터 파이프라인
모델 서빙·드리프트·MLflow, Kafka·Spark·Lakehouse 등 데이터 파이프라인
91 POSTS · 1 / 4
주제 지도
MLOps13
데이터 파이프라인7
Apache Iceberg6
PostgreSQL6
레이크하우스5
Databricks5
pgvector5
데이터 거버넌스4
전체 글
Apache Iceberg v3와 통합 카탈로그가 바꾸는 레이크하우스 운영
Apache Iceberg v3의 삭제 벡터·로우 리니지와 Unity Catalog·Polaris 기반 통합 카탈로그가 레이크하우스 거버넌스와 멀티 엔진 운영에 미치는 변화를 다룬다.
2026-08-02
BigQuery와 Iceberg 엔진을 잇는 서버리스 REST 카탈로그
BigQuery의 서버리스 Iceberg REST 카탈로그로 Spark·Flink·Trino와 단일 테이블을 공유하는 레이크하우스 구조를 분석한다.
2026-08-02
Cloudflare Workers AI의 Unweight·Infire 엣지 LLM 추론 구조
Unweight 무손실 가중치 압축과 Infire 엔진, Prefill·Decode 분리 구조로 구현한 Cloudflare 엣지 LLM 서빙을 분석한다.
2026-08-02
Databricks Lakebase: 서버리스 PostgreSQL과 레이크하우스 HTAP 아키텍처
Databricks Lakebase의 서버리스 PostgreSQL 구조, WAL 기반 분리 저장소, Moonlink CDC와 레이크하우스 HTAP 통합 방식을 분석한다.
2026-08-02
Databricks Omnigent의 멀티에이전트 데이터 오케스트레이션
Databricks Omnigent의 메타 하네스 구조와 Delta Lake 상태 관리, MLflow 추적, Unity Catalog 거버넌스를 실무 관점에서 설명한다.
2026-08-02
Cloudflare Unweight로 이해하는 LLM 가중치 압축과 에지 추론 비용
Cloudflare Unweight가 LLM 가중치를 압축하고 Workers AI 에지 추론의 메모리·배포·비용 구조를 개선하는 방식을 다룬다.
2026-06-10
Cloudflare 엣지 LLM 추론의 프리필·디코딩 분리 설계
Cloudflare가 프리필과 디코딩을 분리해 GPU 활용률을 높이고 글로벌 엣지에서 LLM 추론을 처리하는 구조를 분석한다.
2026-05-19
AI 임상 진단, 응급실 의사를 앞서다: FHIR 통합 아키텍처와 신뢰성 설계
하버드 연구가 보여준 LLM 응급 진단 성능과 FHIR 기반 EMR 통합·불확실성 정량화 아키텍처, FDA 규제·책임 귀속 등 임상 도입 장벽을 정리한다
2026-05-16
학습 데이터가 만든 행동 이상: LLM 독성 필터링과 정렬 훈련 파이프라인 설계
AI 종말론 서사가 모델 행동에 전이된 사례를 계기로 독성 탐지·역할극 데이터 분리·런타임 안전 분류기로 이어지는 LLM 학습 데이터 품질 관리 파이프라인을 정리한다
2026-05-16
Cloudflare Infire: Rust로 처음부터 다시 만든 엣지 분산 LLM 추론 엔진
Cloudflare가 독자 개발한 LLM 추론 엔진 Infire의 텐서·파이프라인·전문가 병렬화, PD 분리 아키텍처, 글로벌 엣지 서빙, Unweight 무손실 가중치 압축을 정리한다
2026-05-11
Apache Iceberg v3의 Row Lineage·Deletion Vectors·VARIANT 이해하기
Apache Iceberg v3의 Row Lineage, Deletion Vectors, VARIANT 타입이 CDC·삭제·반정형 데이터 처리에 미치는 변화를 정리한다.
2026-05-05
Apache Iceberg와 S3 Tables로 설계하는 레이크하우스 아키텍처
Apache Iceberg의 스냅샷, 스키마·파티션 진화와 S3 Tables, 카탈로그 통합을 중심으로 레이크하우스 아키텍처를 정리한다.
2026-04-27
CubeFS의 CNCF 졸업이 증명한 것: POSIX·HDFS·S3를 하나의 스토리지로
CubeFS가 CNCF 졸업 프로젝트로 승격되며 POSIX·HDFS·S3를 단일 스토리지에서 지원하는 설계와 OPPO·JD.com의 실제 적용 사례를 정리한다.
2026-04-26
DeepSeek R2 추론 모델: AIME 92.7%·MATH-500 달성과 수학·논리 추론 LLM 포스트-트레이닝 전략
DeepSeek R2의 AIME·MATH-500 성과와 GRPO/RLVR/DAPO 강화학습 포스트-트레이닝, V4 Pro·Flash의 1M 컨텍스트 효율화, 프로덕션 배포 전략을 정리한다.
2026-04-26
BigQuery와 Earth Engine으로 설계하는 위성 이미지 분석 파이프라인
BigQuery GIS와 Google Earth Engine을 결합해 래스터·벡터 데이터를 분석하고 위성 이미지 AI 파이프라인을 설계하는 방법
2026-04-23
Databricks Lakebase로 구성하는 PostgreSQL 기반 HTAP 레이크하우스
Databricks Lakebase의 PostgreSQL 호환 인터페이스와 Delta Lake 기반 HTAP 구조, ETL 없는 분석 통합 및 마이그레이션 방식을 다룬다.
2026-04-20
Apache Spark 4.1의 Real-Time Mode와 선언적 데이터 파이프라인
Apache Spark 4.1의 Real-Time Mode, Spark Declarative Pipelines, Spark Connect 구조와 도입 시 고려할 제약을 정리한다.
2026-04-17
인증 키 없이 한국 법령 판례를 시맨틱 검색하는 법
국가법령정보센터 법령 99.9%를 수록한 오픈소스 API 법망(Beopmang)의 PostgreSQL·pgvector 아키텍처, 엔드포인트 구조, 활용 사례와 기존 Open API 대비 차이를 정리한다.
2026-04-03
베이지안 의사결정과 A/B 테스트 — 사전분포에서 가드레일까지
베이지안 추론과 효용 함수, Thompson Sampling, A/B 테스트의 SRM·가드레일 운영, 인과추론과 이질성 분석을 코드 예제로 정리한 실무 가이드
2025-12-13
블록체인으로 AI 학습을 조율한다는 것: 분산 학습·데이터 출처·모델 공유
블록체인 스마트컨트랙트로 분산 AI 학습·데이터 출처 추적·모델 공유를 조율하는 아키텍처와 검증·인센티브 설계를 정리한다.
2025-12-13
데이터 사이언스 워크플로우를 표준 운영 절차로 만들기: DVC·MLflow·CI
DVC로 데이터를 버전 관리하고 MLflow로 실험을 추적하며, 입력-처리-출력 SOP와 CI 자동화로 재현성을 검증하는 데이터 사이언스 워크플로우 표준을 정리한다.
2025-12-13
AI 진단 결과를 EHR에 안전하게 쓰는 법: FHIR 기반 헬스케어 IT 데이터 아키텍처
AI 진단·원격의료·EHR 상호운용을 하나의 데이터 파이프라인으로 보고, FHIR 쓰기 실패 처리와 멱등성 설계까지 실무 관점에서 정리한다.
2025-12-12
IoT 디바이스 인증과 데이터 무결성: MQTT-블록체인 앵커링 게이트웨이 설계
IoT 디바이스 신원·데이터 무결성을 블록체인에 앵커링하는 MQTT 게이트웨이 아키텍처와 구현 절차, 제조·에너지·물류 활용 사례를 정리한다.
2025-12-11
분산 학습 데이터가 조작되지 않았다는 걸 어떻게 증명할까: 블록체인 앵커링과 MLOps
분산·연합학습 환경에서 데이터·모델 무결성을 온체인 해시로 앵커링하고 서명된 Docker 이미지로 배포하는 MLOps 파이프라인 설계를 정리한다.
2025-10-31
Airflow, Prefect, Dagster — 데이터 파이프라인 오케스트레이션 도구 어떻게 고를까
Apache Airflow, Prefect, Dagster의 DAG 모델·상태 관리·장애 처리 방식을 비교하고, 조직 상황별 선택 기준과 운영 시 트레이드오프를 정리한다.
2025-10-14
SageMaker·Vertex AI·Azure ML로 MLOps 플랫폼 선택하기
AWS SageMaker, Google Vertex AI, Azure ML Studio의 데이터 관리·학습·서빙·거버넌스 기능과 도입 판단 기준을 비교한다.
2025-10-14
Apache Druid — 시계열 이벤트를 초 단위로 쿼리하는 컬럼 지향 분석 DB
Apache Druid의 컬럼 기반 저장·시간 파티셔닝·실시간/배치 하이브리드 수집 구조와 6개 노드 아키텍처, 실무 도입 시 고려사항을 정리한다.
2025-05-23
Apache Atlas와 Great Expectations로 구축하는 데이터 거버넌스 운영 체계
Apache Atlas의 메타데이터·라인리지 관리와 Great Expectations 품질 검증을 파이프라인, 정책, 감사 체계에 통합하는 방법
2024-04-29
AWS Lambda 서버리스 ML과 하이브리드 클라우드 추론 설계
AWS Lambda 기반 서버리스 ML 추론과 하이브리드 클라우드 아키텍처의 모델 배포, 보안, 확장, 비용 설계 방식을 정리한다.
2024-04-29
클라우드 ML 워크로드 자동 확장과 비용 최적화
클라우드 ML의 온라인·배치 추론과 분산 학습에 맞춘 자동 확장 정책, 비용 제어 레버, 운영 설계 원칙을 정리한다.
2024-04-29