Cloudflare Workers AI의 Unweight·Infire 엣지 LLM 추론 구조

Unweight 무손실 가중치 압축과 Infire 엔진, Prefill·Decode 분리 구조로 구현한 Cloudflare 엣지 LLM 서빙을 분석한다.

2026-08-14 · 최초 발행 2026-08-02

엣지로 옮겨간 대형 모델 서빙

Cloudflare는 2026년 Workers AI 플랫폼을 재설계하면서 Unweight 무손실 가중치 압축, Rust 기반 Infire 추론 엔진, 분리형 Prefill/Decode 아키텍처를 함께 발표했다. 목표는 300개 이상 글로벌 PoP(Point of Presence)에서 트릴리언 파라미터급 대형 언어 모델을 비용 효율적으로 제공하는 것이다. 중앙 클라우드 클러스터에 집중됐던 AI 에이전트 실행 환경을 글로벌 엣지 인프라로 확장하려는 구상도 이 구조에 포함된다.

BF16의 지수 필드를 압축하는 Unweight

Cloudflare Research팀이 개발한 Unweight는 학습된 LLM 가중치의 BF16 텐서에서 필드별 엔트로피가 다르다는 점을 이용한다. BF16 값은 1비트 부호(sign), 8비트 지수(exponent), 7비트 가수(mantissa)로 구성된다. 지수 필드는 8비트를 차지하지만 실제 정보량인 Shannon entropy는 약 2.6비트다. 반면 부호와 가수 필드는 압축 여지가 작아 사실상 비압축 상태에 가깝다.

압축 과정에서는 먼저 BF16 값을 부호·가수 바이트와 지수 바이트로 나눈다. 지수에는 텐서별 16개 값으로 구성한 팔레트(palette)와 Huffman 코딩을 적용하고, 팔레트에 들지 않는 희귀 지수 값은 verbatim row로 분리해 처리한다. 이 방식은 MLP 가중치 텐서를 기준으로 1.44배 압축하며, 전체 모델의 메모리 풋프린트를 최대 22% 줄인다.

압축만으로는 추론 경로의 병목을 해결하기 어렵다. Unweight는 NVIDIA Hopper(H100/H200) GPU의 온칩 공유 메모리(shared memory)에서 가중치를 복원하고, 재구성한 BF16 타일을 WGMMA(Warpgroup Matrix Multiply-Accumulate) 텐서 코어에 바로 공급한다. 가중치 행렬을 복원하기 위한 HBM(High-Bandwidth Memory) 라운드트립을 없애는 구조다.

복원 커널은 ThunderKittens LCF(Low-Cost Fused) 방식의 영속 커널로 구현됐다. 소스 코드는 cloudflareresearch/unweight-kernels GitHub 저장소에 공개돼 있다. 양자화처럼 값을 근사하지 않는 무손실(lossless) 압축이므로 품질 손실이 없으며, 추론 속도도 저하시키지 않는다.

Huffman 인코딩GPU 추론 요청온칩 복원직접 공급출력지수부 팔레트 관리연속 배치 / KV 캐시Prefill 서버Decode 서버KV Cache 전송최종 응답BF16 가중치 텐서(HBM 저장)Unweight 압축 가중치(22% 용량 절감)공유 메모리 로드(HBM 라운드트립 없음)BF16 타일 재구성(ThunderKittens LCF 커널)WGMMA 텐서 코어(H100/H200)LLM 추론 결과Infire 엔진(Rust 기반)분리형 Prefill/DecodeKV Cache 생성(compute-bound)토큰 생성(memory-bound)

Infire가 추론 요청과 GPU 메모리를 다루는 방식

Infire는 기존 vLLM 기반 셋업을 대체하기 위해 Cloudflare의 분산 글로벌 네트워크 환경에 맞춰 만든 Rust 기반 추론 엔진이다. 실행 중인 요청을 토큰 단위로 묶는 연속 배치(Continuous Batching)로 GPU 활용률을 높이고, 페이지드 KV-캐시(Paged KV-Cache)로 메모리 단편화를 줄여 긴 컨텍스트 요청의 처리 효율을 높인다.

저수준 커스텀 커널도 엔진에 포함됐다. Kimi K2.5 같은 대형 모델에 맞춰 데이터·텐서·전문가 병렬화를 적용한다. 이 최적화를 통해 기존 대비 TPS(Tokens per Second) 처리량은 20% 이상 높아졌고 CPU 부하는 대폭 감소했다.

향후 로드맵에는 멀티 GPU 지원, 양자화(quantization), 진정한 멀티테넌시(multi-tenancy)가 포함될 예정이다.

Prefill과 Decode를 서로 다른 서버군에 배치한다

LLM 추론에서 Prefill은 프롬프트 전체를 병렬로 처리하는 FLOP 집약적인 compute-bound 단계다. Decode는 토큰을 하나씩 순차 생성하므로 HBM 대역폭에 영향을 받는 memory-bound 단계다.

단계 처리 방식 병목
Prefill 프롬프트 전체 병렬 처리 Compute-bound, FLOP 집약
Decode 토큰 하나씩 순차 생성 Memory-bound, HBM 대역폭 집약

분리형 아키텍처에서는 Prefill 서버가 KV 캐시를 만든 뒤 이를 Decode 서버로 넘긴다. 두 서버군은 트래픽 패턴에 맞춰 따로 확장할 수 있고, 서로 다른 하드웨어에도 배치할 수 있다. 이 구조를 적용한 결과 p90 인터토큰 레이턴시는 약 100ms에서 20~30ms로 3배 단축됐다.

Workers AI를 기업 시스템에 연결하는 지점

2026년 기준 Workers AI는 200개 이상 도시에 걸친 300+ PoP에서 AI 추론을 제공한다. OpenAI 호환 API를 지원해 기존 코드의 마이그레이션 부담을 줄이며, Llama·Mistral·Phi·Qwen·Kimi 등 50종 이상의 오픈 웨이트 모델을 제공한다. 과금은 서버리스 방식이고 Mistral 7B 기준 가격은 $0.00007/1K 토큰이다.

반복 프롬프트가 많은 환경에서는 Cloudflare의 글로벌 분산 캐시 인프라와 KV 캐시를 함께 활용할 수 있다. RAG 파이프라인에서 되풀이되는 시스템 프롬프트나 문서 컨텍스트의 KV 캐시를 재사용하면 TTFT(Time-To-First-Token)를 추가로 줄일 수 있다.

데이터 현지화가 필요한 시스템에서는 리전별 PoP 지정 기능이 설계 조건이 된다. GDPR, PIPL을 준수해야 하는 기업은 특정 국가나 지역의 GPU에서만 추론하도록 제한해 데이터가 관할권 경계를 벗어나지 않게 하면서 엣지 저지연을 활용할 수 있다.

2026년 주요 엔터프라이즈의 실증 패턴은 엣지와 중앙 클라우드의 역할을 나누는 방식이다. 분류, 콘텐츠 모더레이션, 사기 감지처럼 처리 시간이 짧고 지연에 민감한 추론은 Workers AI에 둔다. GPT-4o, Claude Opus 4 같은 프론티어 모델의 장문 생성과 배치 작업은 중앙 클라우드가 담당한다. Workers의 오케스트레이션 레이어는 라우팅과 게이팅 로직을 실행한 뒤 필요한 요청만 중앙 API로 보낸다.

다른 엣지 실행 환경과의 차이

항목 Cloudflare Workers AI AWS Lambda@Edge Fastly Compute
글로벌 PoP 수 300+ CloudFront 위치 90+
콜드 스타트 ~0ms (무서버 격리) 100ms~1s+ 수십ms
p95 레이턴시 Lambda 대비 4배 빠름 기준치 제한적 AI 지원
AI 전용 GPU 자체 H100/H200 외부 연동 필요 미지원
최대 실행 시간 수분(Workers) 5초(Lambda@Edge) 제한적
모델 카탈로그 50+ 오픈 웨이트 없음(외부 API) 없음
데이터 주권 리전 지정 가능 IAM 정책 기반 제한적
가격(Mistral 7B) $0.00007/1K 토큰 GPU 인스턴스 비용 해당 없음
프론티어 모델 오픈 웨이트 위주 Bedrock 연동 해당 없음

AWS Lambda@Edge는 기존 Node.js 기능을 CDN 엣지로 확장하는 범용 컴퓨팅 레이어이며 AI 추론용 GPU를 내장하지 않는다. Fastly Compute도 엣지 함수 실행 환경을 제공하지만 LLM 추론에 특화된 인프라는 없다. 이에 비해 Cloudflare Workers AI는 현재 엣지 LLM 추론에 특화된 유일한 대규모 엣지 플랫폼이며, 짧고 지연에 민감한 추론에서 우위를 보인다.

압축·GPU·분산 시스템이 만나는 설계

Unweight는 데이터 표현과 압축 이론을 GPU 추론 경로에 적용한 사례다. BF16 텐서 구조와 Shannon entropy를 기준으로 압축 가능성을 찾고, NVIDIA Hopper GPU의 WGMMA 텐서 코어와 HBM·공유 메모리 계층을 이용해 복원 비용을 추론 파이프라인 안에 배치한다.

Prefill과 Decode의 분리는 스케일링 특성이 다른 컴포넌트를 떼어내는 마이크로서비스 분해 원칙과 맞닿아 있다. 이를 엣지-클라우드 하이브리드 구조로 확장하면 계층적 분산 시스템 설계가 된다.

연속 배치, 페이지드 KV-캐시, 캐시 히트율 최적화는 시스템 성능 튜닝에 해당한다. Unweight의 무손실 압축과 품질 손실을 수반하는 양자화 사이의 선택은 알고리즘과 운영 조건을 함께 따져야 하는 트레이드오프다. GDPR, PIPL에 따른 데이터 현지화와 엣지 추론의 결합은 데이터 주권을 인프라 배치로 구현하는 보안·컴플라이언스 설계로 이어진다.

2026년 이후 예고된 변화

Infire v2 로드맵에는 멀티 GPU 텐서 병렬화, INT4/INT8 양자화 통합, 진정한 멀티테넌시 지원이 예고돼 있다. 양자화와 Unweight 무손실 압축을 함께 적용하면 메모리를 추가로 줄이고 처리량을 높일 것으로 기대된다.

Cloudflare의 Agents Week 2026 발표에서는 AI 에이전트가 Workers 런타임에서 지속적으로 실행되는 아키텍처가 부상했다. 이 방향에서 Workers AI의 역할은 단순한 모델 API 호출 대상에서 에이전트 실행 플랫폼으로 이동한다.

현재 Unweight는 기존 대형 모델 압축에 초점을 둔다. 향후 지식 증류(Knowledge Distillation)와 결합해 더 작고 엣지에 적합한 특화 모델을 만드는 파이프라인으로 확장될 것으로 예상된다.

모델 카탈로그도 텍스트에만 머물지 않는다. 이미지 생성의 Stable Diffusion과 음성 인식의 Whisper를 포함하고 있으며, 2026년 말까지 멀티모달 LLM 엣지 서빙으로 확대될 전망이다.

Unweight의 22% 메모리 절감은 동일 GPU에 더 많은 모델 인스턴스를 수용할 수 있게 해 추론 단가 하락을 가속한다. 이는 엣지 AI의 경제적 타당성과 채택 속도를 높일 것으로 전망된다.

Cloudflare가 2026년 Workers AI에 적용한 Unweight 22% 무손실 가중치 압축, Rust 기반 Infire, 분리형 Prefill/Decode 아키텍처는 대형 언어 모델을 엣지에서 제공하기 위한 기술 조합이다. BF16 지수 필드의 엔트로피 비대칭성과 온칩 복원은 압축 알고리즘을 하드웨어 메모리 구조에 결합한다. 기업 환경에서는 데이터 주권과 저지연 추론을 함께 다루는 아키텍처 대안이며, AI 에이전트 인프라와 양자화 통합이 이어지면 엣지 LLM 추론 생태계의 구성이 달라질 것으로 전망된다.

Sources

Cloudflare Workers AI엣지 AILLM 추론가중치 압축모델 서빙