데이터 압축 기술: 무손실·손실 방식과 멀티미디어 표준

데이터 압축의 중복성 제거 원리와 무손실·손실·혼합 방식의 차이, RLE·Huffman·DCT·JPEG·MPEG 표준을 정리한다.

2026-08-14 · 최초 발행 2025-12-25

데이터를 줄이는 방식은 중복성에서 출발한다

데이터 압축은 저장하거나 전송할 데이터에서 불필요한 부분을 덜어 내고 더 효율적인 형태로 바꾸는 기술이다. 저장 공간, 전송 시간, 대역폭 사용량을 줄이는 것이 목적이며, 파일 압축부터 이미지·비디오 코덱과 통신 프로토콜까지 적용 범위가 넓다.

원본을 정확히 되돌려야 하는 경우에는 무손실 압축을 쓴다. 일부 정보를 포기해도 더 높은 압축률이 필요한 이미지·오디오·비디오에는 손실 압축이 사용된다. 두 접근을 결합한 혼합 방식도 멀티미디어 표준에서 활용된다.

무손실손실원본 데이터100MB압축 알고리즘압축 데이터10MB압축 해제복원 데이터100MB(원본과 동일)100MB(유사, 일부 손실)

반복·예측·통계로 데이터 표현을 바꾼다

압축은 반복 패턴을 식별해 제거하거나, 자주 쓰이는 데이터에는 짧은 코드를 배정하는 방식으로 동작한다. 이전 데이터를 바탕으로 다음 값을 예측한 뒤 실제 값과의 차이만 다루는 방법도 있다.

시간적 중복성은 시간상 연속된 데이터가 비슷하게 나타나는 성질이다. 동영상의 연속 프레임처럼 차이가 크지 않은 데이터를 다룰 때 차분 인코딩으로 활용된다. 공간적 중복성은 인접한 데이터의 유사성으로, 이미지에서 가까운 픽셀이 비슷한 색을 보이는 경우가 대표적이다. 블록 단위 변환과 다운샘플링은 이 특성을 이용한다.

특성 내용 효과
공간 절감 저장 용량 감소 비용 절감, 더 많은 데이터 저장
속도 개선 전송 시간 단축 네트워크 효율 증가
대역폭 확대 같은 대역폭으로 더 많은 데이터 처리 처리량 증가

복원 가능성과 압축률에 따른 선택

압축 기술무손실(Lossless)손실(Lossy)혼합(Hybrid)Run-LengthHuffmanArithmetic예측: DPCM, DM변환: FFT, DCT계층적: SubbandVector QuantizationJPEG, MPEGH.261

무손실 압축은 압축 해제 후에도 원본과 완전히 동일해야 하는 텍스트, 프로그램, 중요 데이터에 적합하다. Run-Length, Huffman, LZW, ZIP이 대표적이며 압축률은 2:1 ~ 10:1이다.

손실 압축은 원본을 완벽하게 되돌릴 수 없는 대신 더 높은 압축률을 얻는다. 이미지, 오디오, 비디오 같은 멀티미디어에 사용하며 JPEG, MP3, MPEG, H.264가 여기에 속한다. 압축률은 10:1 ~ 100:1 이상이다.

혼합 압축은 무손실과 손실 기법을 결합해 높은 압축률과 허용 가능한 품질을 함께 다룬다. JPEG, MPEG, H.261/H.264가 대표적인 활용 사례다.

원본을 보존하는 압축 기법

Run-Length Encoding (RLE)

RLE는 같은 데이터가 연속되는 구간을 값과 반복 횟수의 쌍으로 표현한다.

원본AAAABBBCCCCC압축(A,4)(B,3)(C,5)12바이트 6쌍
  • 원본: WWWWWWWWBBBWWWWWW (16바이트)
  • 압축: (W,8)(B,3)(W,6) (6바이트)
  • 압축률: 16/6 ≈ 2.67:1

반복 패턴이 많다면 단순하고 빠르게 동작한다. 반대로 반복이 적은 데이터에서는 크기가 오히려 늘어날 수 있다.

Huffman Coding

Huffman Coding은 문자 빈도에 따라 길이가 다른 코드를 할당한다. 빈도가 높은 데이터에는 짧은 코드를 부여한다.

문자 빈도 고정 코드 Huffman 코드
E 50 000 0
T 30 001 10
A 15 010 110
O 5 011 111
100Root50E (0)5030T (10)2015A (110)5O (111)

원본 크기는 100문자 × 3비트 = 300비트이고, 압축 크기는 50×1 + 30×2 + 15×3 + 5×3 = 170비트다. 압축률은 300/170 ≈ 1.76:1이다.

엔트로피 한계에 가까운 최적 압축과 빠른 디코딩이 장점이다. 다만 빈도 분석이 필요하고 트리 저장 오버헤드가 있다.

Arithmetic Coding

Arithmetic Coding은 메시지 전체를 하나의 실수 구간으로 인코딩한다. 메시지를 [0,1) 구간의 하나의 값으로 표현하며 Huffman보다 높은 압축률을 얻을 수 있다. 구현이 복잡하고 특허 문제가 단점으로 언급된다.

손실을 허용해 압축률을 높이는 기법

DPCM (Differential Pulse Code Modulation)

샘플 n-1100예측기예측값102실제값105차이+3차이만 저장/전송

DPCM은 이전 값에서 현재 값을 예측하고 차이만 인코딩한다. 차이 값은 작으므로 적은 비트로 표현할 수 있으며, 음성과 센서 데이터에 사용된다.

DM (Delta Modulation)

DM은 DPCM을 단순화한 방식으로, 차이를 증가 또는 감소를 나타내는 1비트로 다룬다. 하드웨어가 매우 단순한 대신 품질은 낮다.

FFT (Fast Fourier Transform)

FFT는 시간 도메인의 신호를 주파수 도메인으로 바꾼다. 중요한 주파수 성분만 저장해 압축하며, 오디오 신호 처리에 사용된다.

DCT (Discrete Cosine Transform)

공간 도메인이미지 블록DCT 변환주파수 계수양자화(고주파 제거)압축 데이터

DCT는 공간 도메인의 이미지 블록을 주파수 도메인으로 변환한다. 인간의 눈이 덜 민감한 고주파 성분을 제거해 데이터를 줄이며 JPEG 이미지 압축에 사용된다.

계층적 기법과 Vector Quantization

Bit Position Coding은 중요한 비트만 전송한다. Subband Coding은 신호를 주파수 대역별로 분리해 압축하고, Subsampling Coding은 해상도를 줄이는 방식이다.

Vector Quantization은 벡터 공간을 유한 개의 코드북으로 양자화한다. 높은 압축률을 얻을 수 있지만 코드북 생성과 검색이 복잡하다.

JPEG·MPEG가 기법을 결합하는 방법

JPEG (Joint Photographic Experts Group)

JPEG는 정지 영상 압축 표준으로 DCT, 양자화, Huffman을 결합한다.

  1. 이미지를 8×8 블록으로 분할
  2. DCT 변환 (공간 → 주파수)
  3. 양자화 (고주파 성분 제거, 손실 발생)
  4. Huffman/Arithmetic 코딩 (무손실)

압축률은 품질에 따라 10:1 ~ 50:1이다.

MPEG (Moving Picture Experts Group)

MPEG는 동영상에서 시간적·공간적 중복성을 제거하는 압축 표준이다. I-Frame은 JPEG 방식을 쓰는 독립 프레임이고, P-Frame은 이전 프레임을 바탕으로 예측한다. B-Frame은 이전과 이후 프레임을 함께 이용해 양방향 예측을 수행한다.

I-Frame(키 프레임)P-Frame(예측)B-Frame(양방향)P-FrameI-Frame

압축률은 50:1 ~ 200:1이다.

H.261 / H.264 / H.265

H.261, H.264, H.265는 비디오 회의와 방송을 위한 압축 표준이다.

  • H.261: 비디오 회의 (64kbps ~ 2Mbps)
  • H.264 (AVC): 고화질 비디오 (Blu-ray, 스트리밍)
  • H.265 (HEVC): 4K/8K 초고화질 (H.264 대비 50% 압축률 향상)

압축 기술은 데이터의 중복성을 줄여 저장 공간과 전송 시간을 절약한다. Run-Length와 Huffman Coding 같은 무손실 기법은 원본 복원이 필요한 데이터를 다루고, DPCM·DCT·Vector Quantization 같은 손실 기법은 높은 압축률을 목표로 한다. JPEG, MPEG, H.264 같은 혼합 압축 표준은 두 방식의 장점을 결합해 멀티미디어 압축에 활용된다.

데이터 압축무손실 압축손실 압축Huffman CodingJPEGMPEG