MLOps·데이터 파이프라인
모델 서빙·드리프트·MLflow, Kafka·Spark·Lakehouse 등 데이터 파이프라인
91 POSTS · 2 / 4
Kafka 4.0 KRaft로 설계하는 실시간 ML 피처 스토어 파이프라인
Kafka 4.0 KRaft와 Flink를 중심으로 스트리밍 ML 피처 집계, 온라인 피처 서빙, 이벤트 기반 AI 추론을 설계하는 방법을 정리한다.
2026-08-02
LLM 에이전트로 설계하는 비정형 데이터 품질 자동화 파이프라인
LLM 에이전트를 활용한 비정형 데이터 스키마 추론, 품질 룰 생성, 이상 탐지와 데이터 거버넌스 자동화 설계 방법을 정리한다.
2026-08-02
MIT TLT가 추론 LLM의 롱테일 학습 병목을 줄이는 방식
MIT TLT가 유휴 GPU와 적응형 추측 디코딩을 활용해 추론 LLM의 강화학습 롤아웃 병목을 줄이는 구조와 적용 조건을 설명한다.
2026-08-02
Google Agentic RAG의 멀티에이전트 검색·검증 아키텍처
Google Agentic RAG가 정보 충분성을 평가하고 크로스 코퍼스 검색을 반복하는 멀티에이전트 구조와 비용 전략을 분석한다.
2026-06-10
Keras 3 멀티백엔드 아키텍처: JAX·TensorFlow·PyTorch를 한 API로 묶는 법
무료 공개된 Deep Learning with Python 3판을 바탕으로 Keras 3의 백엔드 추상화 레이어, Functional API·서브클래싱 선택 기준, 혼합 정밀도·그래디언트 누적·분산 훈련 실무 패턴을 정리한다
2026-05-11
700만 개의 가짜 한국인 — NVIDIA가 통계청 데이터로 만든 합성 페르소나셋
NVIDIA Nemotron-Personas-Korea 700만 합성 페르소나 데이터셋의 생성 파이프라인(PGM+Gemma-4-31B)과 한국어 LLM 파인튜닝 활용, 합성 데이터 대 실제 데이터 논쟁을 정리한다.
2026-05-02
DFlash 블록 확산 디코딩: 투기적 디코딩의 드래프트 비용을 상수로 만드는 법
Z.AI가 공개한 DFlash의 블록 확산 드래프팅과 KV 주입 메커니즘을, 자기회귀 디코딩의 병목 및 LLM 추론 가속 기법 전반과 비교해 정리한다
2026-04-26
LLM 기반 자연어-쿼리 변환 시스템: 엔터프라이즈 데이터 접근 민주화의 현재
Text-to-SQL 파이프라인의 스키마 링킹·SQL 생성 아키텍처와 MongoDB Text-to-MQL·Snowflake Cortex Analyst 시맨틱 모델 사례, 정확도 한계와 거버넌스 설계를 정리한다.
2026-04-25
GBrain: YC CEO가 만든 LLM 기반 개인 지식 관리 도구의 설계와 활용
Garry Tan이 공개한 GBrain의 Brain Repo·하이브리드 검색·이중 데이터베이스 아키텍처, MCP 통합, Karpathy의 LLMWiki 스타일과의 비교를 정리한다.
2026-04-11
LightRAG — GraphRAG보다 가벼운 지식 그래프 검색
홍콩대 HKUDS의 LightRAG가 GraphRAG 대비 토큰·비용·지연시간·정확도에서 보이는 성능 격차와 듀얼 레벨 검색 패러다임, 증분 업데이트 구조를 정리한다.
2026-04-11
Transformers 4.50 — 멀티모달 통합·비동기·FP8이 한 번에 왔다
Hugging Face Transformers 4.50의 MultiModalPipeline·비동기 추론 API·FP8 양자화 신기능과 generate()·tokenizer 반환 타입 등 브레이킹 체인지, 마이그레이션 체크리스트를 정리한다.
2026-03-29
파인튜닝인가, 프롬프트 엔지니어링인가 — 2026년의 선택 기준
LLM 파인튜닝과 프롬프트 엔지니어링의 숨겨진 비용·성능 트레이드오프를 비교하고 LoRA·QLoRA·DPO 기법 현황과 상황별 선택 가이드, 하이브리드 접근법을 정리한다.
2026-03-29
Nemotron 9B와 RTX 5090으로 만든 무료 특허 검색 엔진
USPTO 특허 354만 건을 로컬 LLM으로 분류하고 SQLite FTS5로 검색하는 patentllm.org의 기술 스택과 설계 판단을 정리한다
2026-03-27
배치와 스트림을 따로 둘 것인가 — Lambda·Kappa Architecture와 Data Lakehouse의 선택지
Lambda·Kappa Architecture의 구조적 차이부터 Delta Lake·Iceberg·Hudi 같은 Lakehouse 포맷, Bronze-Silver-Gold 통합까지 빅데이터 아키텍처를 정리한다
2026-01-25
데이터를 옮기지 않고 학습하기 — Federated·Swarm·Split Learning 아키텍처 비교
Federated Learning, Swarm Learning, Split Learning의 구조·보안 메커니즘·실무 적용 사례를 비교하고 도입 체크리스트를 정리한다.
2025-12-13
레이크하우스의 실무 축 — 테이블 포맷, 카탈로그 거버넌스, 데이터 메시
Delta Lake·Apache Iceberg 테이블 포맷과 Unity Catalog류 거버넌스, Data Mesh 운영 모델을 코드 예시와 함께 정리한 데이터 레이크하우스 실무 가이드
2025-12-12
MCU 메모리 수백 KB 안에 모델을 넣는 법 — 엣지 AI 경량화 실전 파이프라인
TinyML·ONNX·Pruning·Quantization을 학습부터 배포까지 이어붙인 엣지 AI 경량화 파이프라인과 품질 게이트, 실행 가능한 코드 예시를 정리한다
2025-12-12
Kafka Streams·Apache Pulsar·Redis Streams, 어떤 메시징 계층을 고를 것인가
Kafka Streams, Apache Pulsar, Redis Streams의 처리 모델·일관성·운영 복잡도를 비교하고 지연·처리량 요구에 맞춘 선택·설계 절차를 정리한다
2025-12-12
연합학습을 블록체인으로 조율하기: 데이터 무결성 검증과 AI 마켓플레이스 설계
연합학습·블록체인 데이터 무결성 검증·AI 마켓플레이스를 계층형 아키텍처로 묶어 스마트모빌리티·제조 IoT 사례와 인센티브 설계를 정리한다.
2025-12-11
MLOps를 구성 요소로 쪼개 보기 — 컨테이너·MLflow·관측성·드리프트·CI/CD
MLOps를 컨테이너화, MLflow 실험관리, SLO 기반 관측성, 드리프트 탐지, CI/CD for ML 다섯 요소로 나눠 FastAPI·Kubernetes·MLflow 코드와 함께 정리한다.
2025-12-11
Hadoop, Spark, Dask — 어떤 분산 처리 프레임워크를 언제 써야 하나
Hadoop MapReduce, Apache Spark, Dask의 실행 모델·자원 관리·장애 허용 방식을 비교하고, 워크로드별 선택 기준과 운영 시 주의점을 정리한다.
2025-10-14
IoT 센서 스트림과 Isolation Forest로 이상 탐지 운영하기
IoT 센서 스트림에서 이벤트 타임과 워터마크, Isolation Forest를 결합해 이상 탐지 파이프라인을 운영하는 설계와 구현 기준을 다룬다.
2025-10-14
MLOps 실전 — Docker/Kubernetes 배포, 드리프트 탐지, MLflow로 모델 생애주기 관리하기
모델을 컨테이너로 배포하고 드리프트를 탐지하며 MLflow로 실험·레지스트리를 관리하는 MLOps 실무 구조와 코드 예시를 정리한다.
2025-10-14
한국어 텍스트 전처리 파이프라인: PyKoSpacing·Py-Hanspell·SOYNLP 활용법
한국어 자동 띄어쓰기 PyKoSpacing, 맞춤법 검사 Py-Hanspell, 비지도 토크나이저 SOYNLP를 조합해 한국어 텍스트 전처리 파이프라인을 구축하는 방법과 코드 예제를 정리한다.
2025-05-23
Ray와 TensorFlow Distributed로 구성하는 분산 컴퓨팅 운영
Ray와 TensorFlow Distributed를 활용해 데이터 전처리, 분산 학습, 장애 복구와 관측 체계를 구성하는 실무 가이드
2024-04-29
대용량 데이터 파이프라인 실무 — GPU 가속 집계부터 실시간 대시보드까지
RAPIDS·Dask-cuDF GPU 가속과 Spark Structured Streaming, ClickHouse 서빙으로 구성하는 대용량 데이터·실시간 대시보드 파이프라인 설계를 정리한다.
2024-04-29
Kafka-Python 스트림 처리와 Streamlit 실시간 대시보드 구축
kafka-python으로 이벤트를 소비해 집계하고 Streamlit으로 실시간 렌더링하는 파이프라인을, 오프셋 커밋 전략과 운영 튜닝 포인트까지 코드로 정리한다.
2024-04-29
Kafka와 Spark Structured Streaming으로 설계하는 실시간 분석 파이프라인
Kafka와 Spark Structured Streaming을 중심으로 실시간 분석 파이프라인의 데이터 흐름, 스키마 관리, 장애 복구와 운영 튜닝 기준을 정리한다.
2024-04-29
ML CI/CD 파이프라인 — 테스트 게이트에서 드리프트 기반 재학습까지
데이터 계약·다계층 테스트·레지스트리 게이트·카나리 릴리스를 하나로 엮어 드리프트가 재학습을 자동으로 트리거하는 ML 전용 CI/CD 파이프라인을 구조와 코드로 정리한다.
2024-04-29
Docker·Kubernetes·MLflow로 짜는 MLOps 배포 파이프라인 — 카나리 배포부터 자동 롤백까지
MLflow로 실험·모델을 추적하고 Docker·Kubernetes로 카나리 배포·자동 롤백까지 이어지는 MLOps 파이프라인 구조와 코드 예시를 정리한다.
2024-04-29