페더레이티드 러닝의 보안 집계와 프라이버시 보존 학습

데이터를 옮기지 않고 협력 학습하는 페더레이티드 러닝의 수평·수직 구조, 보안 집계, 차등 프라이버시 운영 방식을 정리한다.

2026-08-14 · 최초 발행 2025-10-14

데이터는 남기고 모델만 함께 학습하는 방식

Federated Learning(FL)은 참여 기관이나 단말이 보유한 데이터를 로컬에 둔 채, gradient나 weight 같은 모델 업데이트만 중앙 오케스트레이터에 보내는 분산 학습 프레임워크다. 중앙집중형 학습과 비교하면 데이터 거버넌스와 컴플라이언스 측면에서 유리하다.

대표적인 흐름은 FedAvg 기반의 라운드 학습이다. 서버가 집계 결과를 이용해 전역 모델을 갱신하고, 참여자는 다음 라운드에서 그 모델을 다시 학습한다.

데이터가 어떻게 나뉘어 있느냐에 따라 H-FL과 V-FL의 설계가 달라진다.

  • Horizontal FL(H-FL)은 기관마다 피처 스키마는 같지만 사용자 집합이 다른 경우다. 여러 병원이 같은 EMR 스키마를 쓰는 상황이 여기에 해당한다. 각 기관이 로컬 학습을 수행한 뒤 업데이트를 평균한다.
  • Vertical FL(V-FL)은 같은 사용자를 대상으로 기관별 피처 스키마가 다른 경우다. 은행의 거래 특성과 통신사의 위치 특성을 결합하는 사례처럼, 암호 프로토콜로 특성을 결합하고 라벨 소유자를 중심으로 손실을 계산해야 한다.

Secure Aggregation은 서버가 개별 클라이언트 업데이트를 복호화하지 않고 합계만 얻도록 하는 암호학적 집계 프로토콜이다. 쌍방 마스킹 또는 키합의 기반의 정보은닉 합산을 사용한다. 생산 환경에서는 드롭아웃 복원, 키 재구성, 재송신 정책을 포함한 SecAgg+ 같은 변형을 고려한다.

Privacy-Preserving ML은 Secure Aggregation, HE, TEE 같은 암호학적 보호와 Differential Privacy(DP)를 결합한다. 목표는 재식별과 멤버십 추론을 막는 것이다. DP-SGD에서는 클리핑과 가우시안 노이즈를 함께 적용해 업데이트의 공격 내성을 높이지만, 유틸리티와 프라이버시 파라미터 ε, δ 사이에는 트레이드오프가 있다.

라운드에서 안전하게 전역 모델을 갱신하는 흐름

라운드는 초기 전역 모델 파라미터, 참여자 목록, K-of-N 수신 임계가 포함된 라운드 설정, Secure Aggregation과 DP 같은 보안 구성으로 시작한다. 모델 버전을 잠근 뒤 클라이언트가 로컬 학습과 마스킹을 수행하고, 보안 채널을 통해 업데이트를 올린다. 서버는 안전하게 합산하고 언마스킹한 뒤 DP 노이즈를 추가해 모델을 갱신한다. 이후 검증과 모니터링을 거쳐 새 전역 모델 버전, 참여 수와 검증 점수, ε 추정 같은 메트릭스, 감사 지표를 남긴다.

Server/AggregatorClient_jClient_iServer/AggregatorClient_jClient_iRound r 시작 → 모델 v 잠금(Version Lock)임계 K 도달 실패 시 라운드 타임아웃/롤백alt[클라이언트 드롭아웃 발생][충분한 업로드(K-of-N)]메트릭, 감사 로그, ε 보고서 기록모델 v, 라운드 r 파라미터, 키교환 파라미터1모델 v, 라운드 r 파라미터, 키교환 파라미터2마스크 공유용 키교환(EC-DH/PRG seed)3상호 키확립 완료4마스킹된 업데이트 g_i + M_i5마스킹된 업데이트 g_j + M_j6드롭아웃 알림, 마스크 해제 보조 프로토콜(재구성)7마스크 상쇄 후 합 Σg, DP 노이즈 추가8모델 v+1 커밋(원자적 갱신), v 언락9새 모델 v+1 브로드캐스트10새 모델 v+1 브로드캐스트11

프로토콜 선택보다 중요한 운영 조건

FedAvg, FedProx, FedOpt 같은 라운드 기반 집계 프로토콜은 데이터 이질성(Non-IID)을 다루기 위해 Proximal term이나 모멘텀을 사용할 수 있다. 클라이언트 샘플링과 에포크·배치 크기 제어는 통신과 연산 사이의 균형을 조절하는 수단이다.

보안 계층에서는 Secure Aggregation으로 서버가 개별 업데이트를 관측하지 못하게 만들고, TLS 전송 암호화와 클라이언트 원격측정 최소화를 병행한다. Differential Privacy는 업데이트에 클리핑과 노이즈를 적용한다. HE와 TEE는 높은 보안 요구가 있을 때 선택할 수 있지만 성능 비용이 따른다.

H-FL은 사용자 중복이 낮다는 가정에서 단순한 집계 구조를 갖고 확장하기 쉽다. 반면 V-FL은 PSI를 통한 ID 정합과 암호 연산이 필요하며, 라벨 소유자가 손실 평가를 주도해야 한다. 이 때문에 레이턴시와 프로토콜 복잡도가 커진다.

라운드 오케스트레이션에는 버전 롤백, 재시도, 타임아웃 전략이 필요하다. K-of-N 임계는 라운드를 안정적으로 진행하는 기준이 된다. 참여 기관과 디바이스의 인증, 코드 서명과 무결성 검증, 감사 추적성도 운영 설계에 포함해야 한다.

구분 성능 확장성 일관성 안정성 운영 편의
수평형 FL(H-FL) 통신 지배적, 로컬 연산 가벼움. DP 도입 시 정확도 소폭 저하 수천~수만 노드까지 확장 용이. 샘플링으로 부하 제어 라운드별 버전 잠금으로 강한 모델 일관성 드롭아웃 내성 높음(K-of-N) 구현 단순, 프레임워크 성숙
수직형 FL(V-FL) 암호 연산/PSI 비용 큼. 레이턴시 증가 참여 기관 수는 소수~수십 권장 피처 정합 오류 시 학습 왜곡 위험 ID 매칭·라벨 소유자 가용성에 민감 프로토콜 복잡, 운영 자동화 난이도 높음

보안 집계가 합산에서 마스크를 상쇄하는 방식

아래 예시는 Python 3.10+, numpy 1.26+ 환경을 전제로 한 교육용 단순화 모델이다. 드롭아웃은 다루지 않으며, 정수 양자화 마스킹과 DP 노이즈 추가를 사용한다. 쌍방 마스킹이 합산 과정에서 상쇄되는 원리와 DP 노이즈 주입 순서를 확인하는 데 목적이 있다.

# pip install numpy
import numpy as np
import hashlib

def pair_seed(i, j, round_id):
    key = f"{min(i,j)}|{max(i,j)}|{round_id}".encode()
    return int.from_bytes(hashlib.sha256(key).digest()[:8], "big")

def gen_pair_mask(dim, seed):
    rng = np.random.default_rng(seed)
    # 정수 마스크(양자화된 업데이트 가정)
    return rng.integers(low=-1000, high=1000, size=dim, dtype=np.int64)

def l2_clip(v, C=10.0):
    norm = np.linalg.norm(v.astype(float))
    if norm > C:
        v = (v.astype(float) * (C / norm))
    return v

def client_update(client_id, peers, grad, round_id):
    # 쌍방 마스킹 합성
    mask = np.zeros_like(grad, dtype=np.int64)
    for p in peers:
        seed = pair_seed(client_id, p, round_id)
        m = gen_pair_mask(len(grad), seed)
        if client_id < p:
            mask = mask + m
        else:
            mask = mask - m
    # 양자화된 업데이트 + 마스크 업로드
    return grad.astype(np.int64) + mask

def secure_aggregate(masked_updates):
    # 서버는 마스크 해제 없이 합만 계산
    return np.sum(masked_updates, axis=0, dtype=np.int64)

def add_dp_noise(agg_update, sigma=1.0):
    noise = np.random.normal(loc=0.0, scale=sigma, size=agg_update.shape)
    return agg_update.astype(float) + noise

# 데모 설정
N = 3
DIM = 5
ROUND_ID = 1

# 로컬 그래디언트(클리핑 후 양자화 예시)
raw_grads = [np.random.randn(DIM) * 2 for _ in range(N)]
clipped = [l2_clip(g, C=5.0) for g in raw_grads]
quantized = [np.rint(g * 100).astype(np.int64) for g in clipped]  # 스케일 100

# 클라이언트 업로드(마스킹)
masked = []
for i in range(N):
    peers = [p for p in range(N) if p != i]
    masked.append(client_update(i, peers, quantized[i], ROUND_ID))

# 서버 집계(마스크 상쇄 효과)
agg = secure_aggregate(masked)

# DP 노이즈 추가 및 스케일 복원
agg_dp = add_dp_noise(agg, sigma=5.0)
global_update = agg_dp / 100.0  # 스케일 역변환

print("Sum of true grads (quantized):", np.sum(quantized, axis=0))
print("Secure-aggregated (without noise):", agg)
print("DP-added global update (dequantized):", global_update)

실행하면 “Sum of true grads”와 “Secure-aggregated (without noise)”가 일치하고, DP 노이즈가 추가된 전역 업데이트가 만들어진다. 실제 환경에서는 드롭아웃 복원, 키 분실 대응, 부호화 범위 오버플로 방지, 부채널 저감을 필수 고려 사항으로 둬야 한다.

기관과 단말 환경에서의 적용 형태

의료 다기관 H-FL에서는 병원들이 동일한 EMR 스키마를 기준으로 로컬 학습을 수행하고 중앙은 데이터를 받지 않은 채 집계한다. Secure Aggregation과 DP를 함께 적용해 환자 프라이버시를 보호한다.

금융 V-FL은 은행의 거래 특성과 카드사의 사용 패턴을 결합하는 형태다. PSI로 ID를 정합하고 암호 상태에서 로지스틱 손실을 계산한다.

모바일 키보드 예측은 단말 내 학습과 배터리·네트워크 aware 샘플링을 활용하는 H-FL 사례다. 클라이언트 차등 프라이버시는 멤버십 추론 방어에 쓰인다. 제조 크로스사이트 불량 예측에서는 공장별 장비 로그를 로컬에서 학습하고 전역 모델을 통해 희소 이벤트 성능을 높인다. 드롭아웃 내성은 설비 점검으로 인한 중단 영향을 줄이는 데 도움이 된다.

보안 경계와 성능 비용을 함께 설계하기

위협 모델에서는 호기심 많은 서버, 호기심 많은 피어, 외부 공격자를 구분한다. Secure Aggregation은 서버의 관측을 제한하고 DP는 재식별 방어를 맡는다.

키 관리에는 클라이언트 인증서와 원격 무결성 측정(TEE/앱 서명)을 적용할 수 있다. 키 파생은 라운드별 일회성 사용을 전제로 한다. 드롭아웃과 지연에는 K-of-N 임계, 타임아웃, 재샘플링으로 대응하며, SecAgg+의 드롭아웃 마스크 복원에는 성능 비용이 따른다.

DP에서는 ε가 낮아질수록 프라이버시는 높아지고 정확도는 낮아진다. 조직의 위험 허용도와 규제 기준에 맞춰 ε 목표를 정해야 한다. 라운드 성공률, 참여율, 유효 업데이트 비율, ε 누적 보고를 기록하고, 이상 탐지로 데이터 포이즈닝과 모델 도둑을 방지한다. 업데이트 압축(Top-k, Sketch), 양자화, 적응형 클라이언트 샘플링은 통신과 연산의 균형을 최적화하는 방법이다.

원천 데이터 비이동 원칙을 지키면 데이터 내외부 반출 승인 건수를 5090% 감소할 수 있다(도메인 의존 추정). Secure Aggregation은 개별 업데이트 노출을 막고, DP는 멤버십 추론 위험을 대폭 완화한다. IID에 가까운 H-FL에서는 중앙집중형 학습 대비 ±13pp 내 성능 수렴 사례가 다수이며, Non-IID 환경에서는 FedProx 등의 보완이 필요하다. 데이터 집적 인프라와 전송 비용은 줄일 수 있지만 암호 연산과 오케스트레이션 운영비는 증가한다.

파일럿은 H-FL, SecAgg, 클라이언트 DP 조합으로 시작하고 K-of-N 임계와 모니터링 체계를 함께 구축하는 접근이 적합하다. 이후 V-FL과 HE·TEE 같은 고급 암호 기법은 ROI와 규제 요구사항을 기준으로 단계적으로 도입한다.

페더레이티드 러닝보안 집계차등 프라이버시수평형 FL수직형 FL