DeepSeek V4 Pro가 바꾼 오픈소스 LLM의 비용 구조

DeepSeek V4 Pro의 MIT 라이선스와 영구 API 가격 인하, 자체 호스팅 조건, 프롬프트 캐싱, 기업 통합 전략을 비용 구조 중심으로 분석한다.

2026-08-14 · 최초 발행 2026-06-10

가격 인하가 모델 선택 기준을 흔든 이유

DeepSeek은 2026년 5월 V4 Pro의 API 가격을 75% 낮춘 정책을 영구 적용하기로 했다. MIT 라이선스로 공개된 1.6조 파라미터 모델을 입력 토큰 기준 GPT-5.5보다 11.5배, 출력 기준으로는 34.5배 낮은 가격에 이용할 수 있게 되면서 비용과 배포 방식은 더 이상 따로 판단하기 어려운 조건이 됐다.

V4 Pro는 2026년 4월 24일 공개된 Mixture-of-Experts(MoE) 기반 대형 언어 모델이다. 전체 파라미터는 1.6조(1.6T)이지만 한 번의 포워드 패스에서 활성화되는 파라미터는 49B다. 매 추론마다 모든 파라미터를 계산하지 않는 구조가 Dense 모델보다 추론 비용을 낮추는 기반이다.

항목 사양
총 파라미터 1.6조(1.6T)
활성 파라미터 49B (포워드 패스당)
아키텍처 Mixture-of-Experts (MoE)
컨텍스트 윈도우 1,000,000 토큰 (1M)
라이선스 MIT
입력 가격 $0.435/M 토큰 (캐시 미스)
캐시 입력 가격 $0.003625/M 토큰
출력 가격 $0.87/M 토큰
HumanEval 점수 89.4%
MBPP 점수 86.2%
SWE-bench 점수 80.6%

모델 가중치는 HuggingFace의 deepseek-ai/DeepSeek-V4-Prodeepseek-ai/DeepSeek-V4-Flash에서 MIT 라이선스로 공개됐다. 상업적 이용을 포함해 사용·수정·배포할 수 있는 경로가 열려 있다.

한시 할인이 영구 가격표가 되다

75% 할인은 원래 2026년 5월 31일까지 적용될 프로모션이었다. DeepSeek은 2026년 5월 22일 이를 영구 정책으로 전환한다고 공식 발표했다. 확정된 가격은 캐시 미스 입력 $0.435/M 토큰, 캐시 히트 입력 $0.003625/M 토큰, 출력 $0.87/M 토큰이다. 캐시 히트 입력은 99% 이상 절감되는 구조다.

LLM API 가격 비교 (출력 토큰기준, $/M)GPT-5.5$30.00/MClaude Opus 4$25.00/MGPT-5.4$15.00/MClaude Sonnet$15.00/MDeepSeek V4 Pro$0.87/M

출력 토큰 가격을 놓고 보면 GPT-5.5의 $30.00/M보다 34.5배, Claude Opus의 $25.00/M보다 28.7배 저렴하다. 코딩 에이전트와 RAG 파이프라인처럼 토큰 사용량이 큰 워크로드에서는 월 수백만 달러 규모의 절감이 가능해지는 격차다.

MIT 라이선스가 여는 배포 경로

MIT 라이선스는 저작권 고지를 유지하면 모델을 사용·수정·배포·판매할 수 있도록 한다. Apache 2.0이나 LLAMA 라이선스와 비교해 조건이 극도로 단순하므로 법무 검토 부담을 줄일 수 있고, 사내에서 파인튜닝한 모델을 상업 제품에 포함하는 선택도 가능하다.

오픈 가중치는 개발자 생태계를 확장하는 수단이기도 하다. 커뮤니티가 파인튜닝 모델과 도구, 통합 라이브러리를 축적할수록 DeepSeek 모델에 대한 의존도는 자연스럽게 높아진다. Meta의 Llama 전략과 닮았지만, DeepSeek은 경쟁력 있는 가격의 관리형 API를 함께 제공해 서비스 수익을 확보하는 경로도 유지한다.

DeepSeek V4 ProMIT 오픈소스자체 호스팅(비용 최적화)관리형 API($0.87/M 출력)기업 커스터마이징파인튜닝 자유데이터 프라이버시온프레미스 운영빠른 도입인프라 불필요변동 비용트래픽 기반 과금AI 제품화상업 배포 가능

저가 API와 프리미엄 모델 사이의 위치

2026년 LLM API 시장은 가격 하락이 빠르게 진행되고 있다. 2025년과 비교해 2026년 주요 모델 가격은 평균 80% 이상 낮아졌고, 향후 12개월 안에 추가로 2~3배 인하될 것으로 예상된다.

가격대를 나눠 보면 초저가 계층에는 Gemini 1.5 Flash가 입력 $0.075/M·출력 $0.30/M, GPT-4.1 Nano가 입력 $0.10/M·출력 $0.40/M, DeepSeek V3가 입력 $0.14/M·출력 $0.28/M으로 자리한다.

중간 계층에서는 DeepSeek V4 Pro가 입력 $0.435/M·출력 $0.87/M, Claude Haiku 4.5가 입력 $1/M·출력 $5/M, GPT-5.4가 입력 $2.50/M·출력 $15.00/M이다. 프리미엄 계층에는 Claude Sonnet의 입력 $3.00/M·출력 $15.00/M, Claude Opus 4의 입력 $5.00/M·출력 $25.00/M, GPT-5.5의 출력 $30.00/M이 놓인다.

DeepSeek V4 Pro가 차지하는 자리는 이 구분만으로 설명하기 어렵다. 가격은 중간 계층에 속하지만 SWE-bench 80.6%, HumanEval 89.4%라는 프리미엄 계층 수준의 벤치마크 성능을 제공하기 때문이다. 무료 자체 호스팅 선택지까지 포함하면 오픈소스 LLM의 가격 기준선 역할을 하며, 폐쇄형 모델 공급자의 마진에도 압력을 준다.

자체 호스팅은 GPU 구성부터 계산해야 한다

오픈 가중치는 비용 최적화와 데이터 주권을 함께 확보할 수 있게 하지만, V4 Pro를 직접 운영하려면 대규모 인프라가 필요하다. 전체 정밀도인 BF16으로 실행할 때 필요한 VRAM은 약 3.2TB다. 현실적인 배포에서는 양자화가 필수적인 이유다.

양자화 형식 필요 VRAM 최소 GPU 구성
BF16 (원본) ~3.2 TB 40× H100 80GB 이상
FP8 혼합 ~500 GB 4× H200 141GB 또는 8× H100 80GB
FP4+FP8 (네이티브) ~320 GB 4× H100 80GB (전문가 병렬)
INT4 (GPTQ/AWQ) ~200 GB 3× H100 80GB

실용적인 엔터프라이즈 배포의 기준점은 8× H100 클러스터다. FP8 혼합 정밀도에서 640GB VRAM을 확보할 수 있다.

DeepSeek V4 Pro 공개 첫날부터 vLLM과 SGLang에는 공식 레시피가 제공됐다. vLLM으로 실행하는 권장 구성은 다음과 같다.

vllm serve deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 1 \
  --dtype fp8 \
  --max-model-len 32768 \
  --enable-expert-parallel \
  --gpu-memory-utilization 0.90 \
  --enable-chunked-prefill \
  --max-num-batched-tokens 32768

--enable-expert-parallel은 MoE 전문가 서브네트워크를 GPU에 나눠 배치해 통신 오버헤드를 줄인다. --dtype fp8은 FP4 전문가와 FP8 어텐션·정규화를 조합한 혼합 정밀도를 사용한다. 긴 컨텍스트의 메모리 효율은 --enable-chunked-prefill로 높이고, --max-num-batched-tokens로 배치 처리량을 끌어올린다.

MoE에서는 토큰마다 전체 전문가 가운데 일부, 보통 2~8개만 활성화된다. 전문가 병렬 처리는 각 전문가 서브네트워크를 서로 다른 GPU에 배치한다. 이 방식은 텐서 병렬 처리보다 통신량을 줄이면서 여러 GPU를 활용한다.

입력 토큰라우터(Router)전문가 GPU 1(Expert 1-8)전문가 GPU 2(Expert 9-16)전문가 GPU 3(Expert 17-24)전문가 GPU 4~8(Expert 25-64)출력 집계

관리형 API와 자체 호스팅의 비용 교차점

8× H100 클러스터의 월 임대 비용을 약 $15,000~$20,000으로 놓고 GPU 가동률을 60%로 가정하면, 같은 처리량을 DeepSeek API로 수행할 때 월 $3,000~$5,000 수준에서 비용이 교차한다.

따라서 월 API 비용이 $3,000~$5,000을 초과하는 시점부터 자체 호스팅의 경제성이 성립하기 시작한다. 운영 인력과 모니터링 시스템, 장애 대응 비용까지 포함하면 실질적인 손익분기점은 더 높아질 수 있다.

기업 트래픽을 한 모델에 몰지 않는 방식

기업 시스템에 MIT 라이선스 LLM을 연결하는 작업은 API 엔드포인트만 바꾸는 문제로 끝나지 않는다. 비용, 성능, 데이터 주권을 함께 다루려면 요청의 성격에 따라 배포 경로를 나누는 하이브리드 구성이 적합하다.

민감 데이터가 포함된 요청은 자체 호스팅한 DeepSeek V4 Pro로 보내고, 그렇지 않은 요청은 비용과 성능 우선도에 따라 관리형 DeepSeek API 또는 GPT-5.5·Claude Opus로 분기할 수 있다.

YesNo저비용 최우선성능 최우선사용자 요청트래픽 분류기(Request Classifier)민감 데이터포함?자체 호스팅DeepSeek V4 Pro(On-premise)비용 우선도?DeepSeek V4 ProManaged API$0.87/MGPT-5.5 / Claude Opus$25-30/M프롬프트 캐시(99% 입력 절감)응답 반환

반복되는 프롬프트와 비실시간 작업의 비용 줄이기

DeepSeek V4 Pro의 캐시 히트 가격은 $0.003625/M 토큰이다. 캐시 미스 가격인 $0.435/M과 비교하면 99.2% 절감된다. 시스템 프롬프트와 RAG 컨텍스트, few-shot 예시처럼 반복되는 내용을 캐시 영역에 두면 실제 사용 비용을 크게 낮출 수 있다.

캐시 재사용률을 높이려면 시스템 프롬프트와 지침, 예시 같은 정적 콘텐츠를 프롬프트 앞부분에 고정하고 사용자 질의와 변동 데이터는 뒤에 배치한다. 캐시 세그먼트는 최소 1,024 토큰이어야 하므로 캐싱이 활성화되는 단위도 확인해야 한다. RAG에서는 동일 문서가 반복 참조되는 패턴을 찾아 재사용 가능한 청크로 다룬다.

콘텐츠 생성, 데이터 분류, 번역 파이프라인처럼 실시간 응답이 필요하지 않은 워크로드는 배치 API로 처리할 수 있다. DeepSeek과 주요 제공업체는 배치 처리에 추가 50% 할인을 제공하는 경우가 많다.

# 배치 처리 파이프라인 예시 (개념 코드)
import asyncio
from openai import AsyncOpenAI  # DeepSeek은 OpenAI 호환 API 제공

client = AsyncOpenAI(
    base_url="https://api.deepseek.com/v1",
    api_key="YOUR_API_KEY"
)

async def process_batch(items: list[str], batch_size: int = 50):
    semaphore = asyncio.Semaphore(batch_size)
    
    async def process_single(item):
        async with semaphore:
            response = await client.chat.completions.create(
                model="deepseek-v4-pro",
                messages=[{"role": "user", "content": item}],
                max_tokens=1024,
            )
            return response.choices[0].message.content
    
    tasks = [process_single(item) for item in items]
    return await asyncio.gather(*tasks)

DeepSeek V4 Pro는 OpenAI 호환 API 인터페이스를 제공한다. 기존에 OpenAI SDK를 사용하는 코드베이스라면 base_url을 바꿔 연결할 수 있다.

오픈소스 LLM 경쟁이 향하는 곳

불과 2년 전에는 GPT-4 수준의 코딩 능력이 폐쇄형 모델의 영역으로 여겨졌다. DeepSeek V4 Pro의 SWE-bench 80.6%는 해당 벤치마크를 정의했던 GPT-4 Turbo를 훨씬 웃돈다. 오픈소스 모델이 폐쇄형 최고 성능 모델과 동등하거나 그 이상의 코딩 역량을 갖추는 전환점으로 기록될 것이다.

Meta의 Llama 4 시리즈는 자체 호스팅에서 API 비용이 들지 않는다는 강점을 내세운다. DeepSeek은 관리형 API 가격 $0.87/M과 MIT 라이선스 오픈 가중치를 함께 제공한다. Llama가 Meta 생태계를 중심으로 발전하는 것과 달리, DeepSeek은 중국 기반 연구팀의 빠른 반복 개발 속도를 경쟁 수단으로 삼는다.

가격 기준선도 계속 내려가고 있다. Gemini Flash는 $0.075~$0.30/M, DeepSeek V3는 $0.14/$0.28/M, V4 Pro는 $0.435/$0.87/M이다. 고성능 저가 모델의 확산은 OpenAI와 Anthropic 같은 폐쇄형 공급자에게 프리미엄 계층인 GPT-5.5와 Claude Opus의 차별화를 강화하거나 가격 경쟁에 참여하도록 압박한다.

DeepSeek V4 Pro가 제시한 선택지는 관리형 API와 자체 호스팅 중 하나를 고르는 데 그치지 않는다. 출력 토큰 $0.87/M, GPT-5.5 대비 34.5배 낮은 가격, SWE-bench 80.6%와 HumanEval 89.4%의 성능을 한 모델에서 검토할 수 있게 했다. FP8 양자화와 전문가 병렬 처리, 프롬프트 캐싱을 결합하면 대규모 워크로드의 비용을 더 낮출 수 있다. 기업의 AI 아키텍처에서는 이제 성능뿐 아니라 라이선스, 데이터 위치, 캐시 재사용률과 운영 비용을 같은 설계 안에 놓아야 한다.

Sources

DeepSeek V4 Pro오픈소스 LLMMIT 라이선스자체 호스팅프롬프트 캐싱