하둡 에코시스템: HDFS·MapReduce·YARN 위에 쌓이는 도구들

하둡 코어(HDFS·MapReduce·YARN)를 중심으로 수집·저장·처리·워크플로우·거버넌스 도구가 어떻게 연결되는지, 산업별 활용 사례와 함께 정리한다.

2026-08-13 · 최초 발행 2025-05-23

구글 논문에서 시작된 오픈소스 빅데이터 플랫폼

하둡은 대용량 데이터를 분산 처리하는 자바 기반 오픈소스 프레임워크다. 구글의 GFS(Google File System)와 MapReduce 논문에서 영감을 받아 더그 커팅(Doug Cutting)이 개발했고, 2006년 아파치 재단 프로젝트로 시작해 빅데이터 처리의 핵심 플랫폼으로 자리잡았다. 페타바이트(PB) 규모의 데이터를 저비용 하드웨어 클러스터에서 분산 처리할 수 있고, 데이터의 폭발적 증가와 비정형 데이터 처리 필요성이 등장 배경이다.

저장은 HDFS, 연산은 MapReduce, 자원관리는 YARN이 맡는다

HDFS(Hadoop Distributed File System)는 대용량 파일을 블록 단위로 쪼개 클러스터 여러 노드에 분산 저장하는 파일 시스템이다. 기본 블록 크기는 128MB(하둡 2.x 기준)이고 필요에 따라 조정할 수 있다. NameNode가 메타데이터를, DataNode가 실제 데이터를 관리하는 마스터-슬레이브 구조이며 기본 복제 계수 3으로 내결함성을 확보한다. 한 번 쓰고 여러 번 읽는(Write-once, Read-many) 패턴에 최적화됐다.

MapReduce는 대용량 데이터의 분산 처리를 위한 프로그래밍 모델이다. Map 단계(데이터 추출·변환)와 Reduce 단계(집계·요약)로 구성되고, 원래는 JobTracker와 TaskTracker로 작업을 관리했으나 하둡 2.0부터 자원 관리 기능이 YARN으로 분리됐다. Java·Python·R 등 다양한 언어로 작성할 수 있다.

Input DataMap 1Map 2Map 3Shuffle & SortReduce 1Reduce 2Final Output

YARN(Yet Another Resource Negotiator)은 하둡 2.0에서 도입된 클러스터 자원 관리 시스템이다. ResourceManager가 전체 클러스터 자원을, NodeManager가 개별 노드 자원을 관리한다. MapReduce 외에도 Spark·Flink 같은 다양한 처리 엔진을 지원하고, 동적 자원 할당과 다중 테넌시(Multi-tenancy)로 자원 효율을 높이며 애플리케이션 수준의 고가용성을 제공한다.

클라이언트ResourceManagerNodeManager 1NodeManager 2NodeManager 3Container 1Container 2Container 3Container 4Container 5Container 6

수집부터 거버넌스까지 이어지는 도구들

데이터를 끌어오는 축은 Flume·Sqoop·Kafka다. Flume은 로그·이벤트 데이터를 수집·집계·이동하는 분산 서비스로 Source-Channel-Sink 구조로 파이프라인을 구성하고 실시간 로그 수집에 적합하며 HDFS·HBase 등과 통합된다. Sqoop은 관계형 데이터베이스와 하둡 사이에서 데이터를 주고받는 도구로, RDBMS에서 HDFS·Hive·HBase로 데이터를 가져오거나(import) 반대로 내보낼(export) 수 있고 MapReduce 기반으로 병렬 처리와 내결함성을 제공한다. Kafka는 분산 스트리밍 플랫폼으로 높은 처리량과 낮은 지연시간으로 실시간 데이터 스트림을 처리하며 Publish-Subscribe 모델을 기반으로 데이터 파이프라인의 핵심 컴포넌트 역할을 한다.

저장 축에는 HBase와 Cassandra가 있다. HBase는 구글 Bigtable에서 영감을 받은 분산 컬럼 기반 NoSQL 데이터베이스로 HDFS 위에서 실행되며 실시간 랜덤 읽기/쓰기를 제공하고, 테이블은 Row Key·Column Family·Column·Version으로 구성돼 수십억 행과 수백만 열의 대형 테이블을 지원한다. Cassandra는 페이스북이 개발한 분산 NoSQL 데이터베이스로 고가용성과 선형적 확장성을 갖췄고 탈중앙화된 P2P 아키텍처에 CQL(Cassandra Query Language)로 SQL과 비슷한 인터페이스를 제공한다.

처리·분석 축은 Hive·Pig·Spark·Flink가 나눠 맡는다. Hive는 하둡 위의 데이터 웨어하우징 솔루션으로 HiveQL이라는 SQL과 비슷한 쿼리 언어를 제공하고 쿼리를 MapReduce·Tez·Spark 작업으로 변환하며 스키마 정의와 테이블 파티셔닝을 지원해 대용량 배치 분석에 적합하다. Pig는 대용량 데이터셋 분석을 위한 고수준 스크립팅 언어(Pig Latin)로 복잡한 MapReduce 변환을 간단한 스크립트로 작성할 수 있어 ETL·데이터 파이프라인 구축에 쓰인다. Spark는 인메모리 컴퓨팅 기반의 통합 분석 엔진으로 배치·스트림 처리, 머신러닝, 그래프 처리 등 다양한 워크로드를 지원하고 RDD·DataFrame·Dataset API를 제공하며 인메모리 처리 시 하둡보다 최대 100배 빠른 성능을 낸다. Flink는 스트림·배치 처리를 위한 분산 처리 엔진으로 이벤트 시간 기반 윈도우 처리를 지원하고 상태 관리와 정확히 한 번(exactly-once) 처리 의미를 보장해 실시간 분석·ETL 워크로드에 적합하다.

Spark CoreSpark SQLSpark StreamingMLlibGraphXSparkR

워크플로우는 Oozie와 Airflow가 조정한다. Oozie는 하둡 작업의 워크플로우 스케줄링·조정 시스템으로 종속성 관리를 통해 작업을 시퀀싱하고 MapReduce·Pig·Hive·Sqoop 작업 등을 조정하며 시간 기반·데이터 기반 트리거를 지원한다. Airflow는 프로그래밍 방식으로 워크플로우를 작성·스케줄링·모니터링하는 도구로 DAG(Directed Acyclic Graph)로 작업 의존성을 정의하고 Python 기반이라 유연하며 웹 UI로 모니터링과 문제 해결을 지원한다.

보안·거버넌스는 Ranger·Knox·Atlas가 맡는다. Ranger는 하둡 에코시스템 전반의 중앙집중식 보안 관리 도구로 세분화된 접근 제어 정책을 설정하고 사용자 인증·권한 부여·데이터 암호화를 지원하며 감사 로깅·보고 기능을 갖췄다. Knox는 하둡 클러스터를 위한 REST API·애플리케이션 게이트웨이로 엔터프라이즈 수준 보안의 단일 접점을 제공하고 SSL/TLS 암호화와 LDAP/Active Directory 통합, 토폴로지 관리·서비스 URL 재작성을 지원한다. Atlas는 메타데이터 관리·거버넌스 플랫폼으로 데이터 계보(Lineage)를 추적하고 비즈니스·기술 메타데이터를 분류하며 규정 준수·감사 요구사항을 지원한다.

전체를 하나로 이으면

보안 & 거버넌스워크플로우 관리처리 & 분석저장데이터 수집FlumeSqoopKafkaHDFSHBaseCassandraMapReduceYARNSparkHivePigFlinkOozieAirflowRangerKnoxAtlas

산업별로 이 스택이 실제로 도는 방식

금융권은 고객 데이터를 통합해 종합 프로필을 만드는 고객 360도 뷰 구축에 이 스택을 쓴다. HDFS에 데이터를 저장하고 Hive로 분석한 뒤 Spark ML로 고객 세그먼트를 예측하는 식이다. 실시간 사기 탐지는 Kafka로 거래 데이터를 실시간 수집하고 Flink로 스트림 처리한 뒤 HBase에 알림을 저장하며, 리스크 모델링은 Sqoop으로 관계형 DB 데이터를 가져와 Spark로 모델을 학습하고 Oozie로 워크플로우를 관리한다.

통신 산업은 Flume으로 네트워크 장비 로그를 수집해 HDFS에 저장하고 Hive로 분석해 성능을 최적화하는 네트워크 로그 분석, Spark ML 알고리즘과 Airflow의 모델 재학습 자동화로 통화·서비스 이용 패턴에서 고객 이탈을 예측하는 작업, HBase에 위치 데이터를 저장하고 Spark로 핫스팟을 분석하는 위치 기반 서비스 최적화에 이 스택을 쓴다.

소매업은 Hive로 데이터 웨어하우스를 구축하고 Spark MLlib으로 모델을 학습해 판매·날씨·이벤트를 반영한 수요를 예측하고, MapReduce 알고리즘으로 장바구니 연관 규칙을 도출해 시각화 도구와 연동하며, Kafka로 판매 데이터를 스트리밍하고 Flink로 처리해 HBase에 재고 현황을 저장하는 실시간 재고 관리를 운영한다.

의료 산업은 HDFS에 환자 기록·치료 결과·의약품 효과를 저장하고 Ranger로 민감 정보를 보호한 뒤 Hive로 분석하는 환자 데이터 분석, HDFS에 분산 저장한 대규모 DNA 시퀀싱 데이터를 Spark로 병렬 처리하는 유전체 분석, Pig로 데이터를 변환하고 Spark로 지리공간 분석을 수행한 뒤 Atlas로 데이터 계보를 추적하는 질병 확산 예측에 이 스택을 적용한다.

이 스택이 지금 마주한 방향과 부담

AWS EMR·Azure HDInsight·Google Dataproc 같은 클라우드 기반 하둡 서비스가 늘고 있고, 온프레미스와 클라우드를 섞어 쓰는 하이브리드 환경에서는 데이터 이동·관리가 과제로 남는다. 자동 스케일링과 서버리스 아키텍처로 진화하는 흐름도 있다.

배치 중심에서 실시간 분석으로 무게중심이 옮겨가면서 Kafka·Flink·Spark Streaming 같은 스트림 처리 기술이 발전했고, 배치와 스트림을 함께 쓰는 람다 아키텍처에서 스트림 중심의 카파 아키텍처로 넘어가는 흐름도 나타난다. Docker·Kubernetes로 하둡 서비스를 배포하는 사례가 늘면서 마이크로서비스 아키텍처가 유연성을 높이고 자원 관리·스케줄링 효율을 개선하고 있다. 머신러닝·딥러닝 워크로드 지원도 강화되는 중이다 — Spark MLlib, TensorFlow on YARN 같은 통합 솔루션이 확대되고 자동화된 ML 파이프라인 구축 도구도 발전하고 있다.

다만 복잡한 설정과 운영 관리는 여전히 부담이다. 다양한 컴포넌트 간 호환성·버전 관리 문제, 전문 인력 부족과 높은 학습 곡선, 데이터 품질·거버넌스 체계 확립, 보안·규정 준수 대응이 과제로 남는다.

Hadoop빅데이터MapReduceYARN에코시스템