HPC 클러스터 아키텍처: 인터커넥트·병렬 파일시스템·스케줄러가 맞물리는 방식

FLOPS 중심 성능 지표부터 인터커넥트·병렬 파일시스템·스케줄러 구성, Slurm 배치 실행까지 HPC 클러스터의 구조와 운영을 정리한다.

2026-08-13 · 최초 발행 2025-11-26

CFD 시뮬레이션이 단일 노드에서 열흘 걸리던 작업을, 256개 노드로 나눠 여섯 시간 만에 끝낼 수 있다면 그 차이를 만드는 것은 GPU 한 장이 아니라 노드·인터커넥트·파일시스템·스케줄러가 함께 맞물리는 클러스터 전체의 설계다.

HPC란 무엇을 위한 인프라인가

HPC(High-Performance Computing)는 고성능 CPU·GPU·FPGA 같은 이기종 자원을 고속 인터커넥트로 연결해 대규모 병렬 연산을 수행하는 컴퓨팅 패러다임이다. 슈퍼컴퓨터로 구성하거나 일반 서버를 클러스터로 묶어 구성하며, 작업 스케줄러와 병렬 파일시스템 기반의 고효율 일괄처리(batch) 운영이 특징이다.

성능은 FLOPS(Floating-point Operations Per Second, 초당 부동소수점 연산 횟수)를 표준 지표로 삼고 mFLOPS·GFLOPS·TFLOPS·PFLOPS로 단위를 확장한다. IPS(Instructions Per Second)도 MIPS 형태로 쓰이지만 ISA·마이크로아키텍처 차이 때문에 비교에 한계가 있어, HPC 성능 비교에는 FLOPS를 우선 적용한다.

핵심 소프트웨어 스택은 계층별로 나뉜다. 분산 병렬에는 MPI·SHMEM, 공유 메모리 병렬에는 OpenMP, 가속기에는 CUDA·HIP·OpenACC를 쓴다. 스케줄러·리소스 매니저로는 Slurm·PBS Pro·LSF가, 병렬 파일시스템으로는 Lustre·IBM Spectrum Scale(GPFS)·BeeGFS가, 컨테이너로는 Apptainer(Singularity)가 표준적으로 쓰인다.

노드부터 파일시스템까지: 클러스터 구성요소

CPU 노드는 범용성이 강점이라 분기·메모리 중심 워크로드에 적합하며, 코어 다수화와 AVX-512 같은 벡터화를 지원한다. GPU·FPGA 가속은 대규모 벡터·행렬 연산을 가속해 AI 학습·추론, 선형대수, 이미지·신호처리 성능을 극대화한다.

고속 인터커넥트는 InfiniBand, HPE Slingshot, NVIDIA NVLink 등으로 저지연·고대역 통신을 제공하며, Fat-tree·Dragonfly·Hypercube 같은 토폴로지 최적화로 AllReduce·AlltoAll 같은 집단통신 효율을 높인다.

병렬 파일시스템은 메타데이터 서버(MDS)와 오브젝트 스토리지 타겟(OST)을 분리해 스루풋을 확장하고, POSIX 일관성 기반 잠금 관리와 스트라이핑으로 대용량 I/O를 최적화한다.

스케줄러·리소스 관리는 큐·파티션·우선순위(QoS)·프리엠션 정책으로 공정성과 자원 활용률을 극대화하며, 노드·코어·GPU·메모리·라이선스 같은 복합 자원에 원자적 할당과 점유 락을 걸어 경합을 방지한다.

개발 툴체인과 성능 최적화는 Nsight·VTune·TAU 같은 프로파일러로 병목을 진단하고, MPI 집단통신·메모리 접근 패턴을 최적화하며, BLAS·cuBLAS·FFTW·MKL 같은 수치 라이브러리로 성능 휴리스틱을 표준화한다.

작업이 실행되는 흐름

제출→자원 락→계산→병렬 I/O→결과 산출로 이어지는 흐름이다. 체크포인트가 실패하면 재시작하고, 타임아웃이 나면 프리엠션이나 재큐잉을 한다. 스케줄러의 자원 락이 배타적 실행을 보장하고, 파일시스템 잠금이 메타데이터 일관성을 유지한다.

가용불가성공실패/타임아웃사용자 입력: 코드/데이터/배치스크립트스케줄러 제출(sbatch/qsub)자원 가용성 체크자원 예약 노드 획득대기/백필(Backfill)데이터 스테이징 (병렬 FS,버퍼/캐시)작업 실행: MPI/OMP/GPU체크포인트 주기재시작(Checkpoint/Restart)결과 쓰기: 병렬 I/O, POSIX일관성모니터링/로그 수집(Prometheus/ELK)출력: 결과/메트릭/아티팩트

실무에서 HPC가 쓰이는 곳

AI 대규모 학습에서는 수십~수백 TB 규모의 이미지·텍스트 데이터를 데이터 병렬과 모델 병렬을 혼합해 처리하며, NCCL AllReduce와 FP16/BF16 혼합정밀로 학습 시간을 단축하고 체크포인트를 주기적으로 저장한다. 계산유체역학(CFD)·유한요소 해석에서는 격자 수 10^8 이상의 문제를 도메인 분할과 MPI halo 교환, 스파스 선형해 프리컨디셔닝으로 풀어 수렴 시간을 줄이고 설계 파라미터 스윕을 자동화한다. 유전체·생명정보학에서는 WGS/WES 시퀀싱 읽기 정렬·변이 호출을 샤딩·배치 처리와 고속 병렬 I/O, 컨테이너 기반 재현성으로 처리해 파이프라인 소요 시간을 줄이고 Q30·커버리지 같은 품질 메트릭을 보장한다. 금융 리스크·몬테카를로에서는 수백만 개 시나리오와 경로 의존 옵션 평가를 독립 경로 병렬과 RNG 스트림 분리, reduce 집계로 처리해 VaR·ES 집계 시간을 줄이고 실시간 리밸런싱을 가능하게 한다.

규모가 커질 때 생기는 효과와 한계

단일 1 TFLOPS 대비 1 PFLOPS 클러스터는 이론적으로 연산량이 1000배지만, 통신·I/O 오버헤드를 고려하면 실효 가속은 100500배 수준이다. 예컨대 CFD 작업이 1노드에서 10일 걸린다면 256노드·병렬 효율 65% 가정 시 6시간으로 줄어드는 것이 합리적인 추정치다. 문제 크기를 고정한 강한 스케일(strong scaling)에서는 Amdahl 한계가 존재해 통신 최적화로도 7090% 효율이 현실적 목표이며, 문제 크기를 노드 수와 함께 늘리는 약한 스케일(weak scaling)에서는 선형에 가까운 성능 확장을 기대할 수 있다.

비용·에너지 측면에서는 작업당 비용(TCO/throughput)이 310배, 가속기를 활용한 전력당 성능(GFLOPS/W)이 520배 개선될 수 있다. 품질·재현성 측면에서는 컨테이너·버전 고정·체크포인트로 재현성이 강화되고, 중앙 스케줄링으로 자원 충돌과 환경 편차가 줄어든다.

아키텍처 성능 확장성 일관성(프로그래밍) 안정성 운영 편의
CPU 클러스터 범용 연산 안정적, 스칼라+벡터 혼합에 강점 노드 수 확장 용이, 통신 병목 영향 중간 MPI/OpenMP 성숙, 이식성 우수 드라이버 의존 적음 운영 단순, 소프트웨어 호환성 우수
GPU 클러스터 행렬·텐서 연산 탁월, AI/LA 최고 효율 대규모 AllReduce 최적화 필요 CUDA/HIP/호환 레이어 필요, 학습 곡선 존재 드라이버·런타임 안정성 관리 필요 컨테이너 권장, 파이프라인 표준화 필요
FPGA/특수가속 초저지연·저전력, 특정 커널 압도적 애플리케이션 특화 확장 HDL/HLS 요구, 개발 난이도 높음 하드웨어 검증 중요 운영 자동화 난이도 높음

구축과 운영에서 확인할 것

구축은 통신 집약 워크로드인지 계산 집약 워크로드인지, 목표 FLOPS·IOPS와 타임투솔루션, 예산·전력·냉각·공간 제약을 정리하는 요구사항 정제로 시작한다. 이어서 노드 스펙(CPU/GPU 메모리 대역폭), 인터커넥트(IB NDR/HDR), 파일시스템(Lustre/GPFS)의 용량·스트라이핑 전략, 스케줄러 파티션·QoS·프리엠션 정책, AD/LDAP·IAM 같은 보안 정책을 설계한다. 구현·테스트 단계에서는 HPL·HPCG·IO500 같은 마이크로벤치마크와 ib_write_bw로 네트워크 레이턴시·대역을 측정하고, 프로세스·스레드 바인딩, NUMA·메모리 핀닝, I/O 패턴 최적화로 대표 워크로드를 튜닝한다. 운영·최적화 단계에서는 Prometheus+Grafana로 모니터링·알림을 하고 자동 스케일링·백필을 적용하며, 체크포인트·재시작과 소프트웨어 스택 버전 고정, 보안 패치 윈도우를 운영한다.

모범사례로는 Apptainer 컨테이너로 재현성·의존성을 격리하고, 데이터 로컬리티를 확보하며 스트라이프·버퍼 크기 조정으로 I/O 상수를 최적화하는 것, 프리엠션 가능한 짧은 잡을 우선 배치해 클러스터 활용률을 높이는 것, 주기적 체크포인트로 장애 MTTR을 단축하는 것이 꼽힌다. 트레이드오프로는 강한 스케일에서 통신 오버헤드와 노드 수 증가가 상충하고, GPU의 높은 성능·전력 효율은 드라이버·소프트웨어 복잡성과 맞바뀌며, 병렬 파일시스템의 고성능은 운영 복잡도·비용 증가를 동반한다.

Slurm 배치 실행 예시

전제조건: Slurm 22+, OpenMPI 4+, Apptainer 1.1+, IB/HDR 네트워크.

배치 스크립트 예시(run.sbatch):

#!/bin/bash
#SBATCH -J mpi_test
#SBATCH -N 4
#SBATCH --ntasks-per-node=8
#SBATCH -t 02:00:00
#SBATCH -p compute
#SBATCH --exclusive

module load mpi/openmpi/4.1
srun --mpi=pmix_v3 --cpu-bind=cores ./app_mpi -i input.dat -o out.dat

MPI 벤치마크 실행 예시(HPL 컨테이너):

srun -N 8 -n 256 apptainer exec hpl.sif xhpl

핵심 튜닝 포인트는 프로세스 바인딩(--cpu-bind), NUMA 인식, 메시지 크기별 집단통신 알고리즘 선택(NCCL/MPI 환경변수)이다.

HPC슈퍼컴퓨터병렬컴퓨팅SlurmMPI