DeepSeek V4 Pro의 오픈웨이트 MoE 구조와 코딩 성능

DeepSeek V4 Pro의 MoE 구조, 코딩 벤치마크, API 가격과 온프레미스 배포 조건을 GPT-5.5 Pro 및 V4 Flash와 비교한다.

2026-08-14 · 최초 발행 2026-06-10

거대한 모델에서 일부 전문가만 움직인다

DeepSeek이 2026년 4월 24일 공개한 V4 Pro는 전체 가중치를 Hugging Face에 배포한 MIT 라이선스 언어 모델이다. 총 파라미터는 1.6조 개지만, 토큰을 처리할 때 실제로 활성화되는 파라미터는 49B다. 모델 용량과 추론 효율을 함께 확보하기 위해 Mixture-of-Experts(MoE) 구조를 사용한다.

각 레이어에는 384개의 라우팅 전문가와 1개의 공유 전문가가 있다. 라우터는 입력 토큰마다 384개 가운데 6개 전문가를 선택하고, 공유 전문가는 항상 활성화한다. 모든 파라미터를 매번 계산하는 Dense 모델과 달리 필요한 경로만 사용하는 희소 활성화 방식이다.

입력 토큰라우터 (Router)전문가 선택384개 6개 활성화전문가 1전문가 2전문가 3전문가 4전문가 5전문가 6공유 전문가(항상 활성)출력 집계다음 레이어 또는 출력

장문 입력에는 Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA)을 혼합해 대응한다. 100만 토큰 컨텍스트를 처리할 때 단일 토큰 추론 대비 FLOPs의 27%, KV 캐시의 10%만 소비한다. DeepSeek-V3.2보다 개선된 이 구조는 대규모 코드베이스와 긴 문서를 하나의 컨텍스트에서 다루는 비용을 낮춘다.

학습에는 AdamW 대신 Muon 옵티마이저를 사용했다. 조 단위 파라미터 환경에서 빠른 수렴을 노린 선택이며, 코드·수학·구조적 추론 데이터에 무게를 둔 학습 코퍼스와 결합해 코딩 성능을 끌어올렸다.

벤치마크마다 달라지는 GPT-5.5 Pro와의 우위

V4 Pro가 모든 코딩 평가에서 GPT-5.5 Pro를 앞서는 것은 아니다. LiveCodeBench에서는 강한 우위를 보이지만, 실제 저장소 수준의 작업을 평가하는 SWE-bench 계열에서는 결과가 엇갈린다.

코딩 벤치마크 비교 (2026)LiveCodeBenchSWE-bench VerifiedSWE-bench Pro1009080706050403020100점수 (%)

LiveCodeBench에서 V4 Pro는 93.5점을 기록해 공개 평가 모델 중 최고 수준에 올랐다. SWE-bench Verified는 V4 Pro 80.6%, GPT-5.5는 약 79%로 비슷하다. SWE-bench Pro에서는 GPT-5.5가 58.6%, V4 Pro가 55.4%다. 벤치마크별 격차는 2-5%p 수준이며, 태스크에 따라 어느 모델이 유리한지 달라진다.

항목 DeepSeek V4 Pro GPT-5.5 Pro
LiveCodeBench 93.5 ~88
SWE-bench Verified 80.6% ~79%
SWE-bench Pro 55.4% 58.6%
AI Intelligence Index 52 N/A
입력 가격($/백만 토큰) $1.74 ~$30
출력 가격($/백만 토큰) $3.48 ~$180
라이선스 MIT (오픈웨이트) 폐쇄형

성능만큼 큰 차이는 가격과 운영 방식에서 나타난다. V4 Pro의 API 가격은 입력 $1.74/백만 토큰, 출력 $3.48/백만 토큰이다. GPT-5.5 Pro와 비교하면 출력 토큰 기준 약 50-70배 저렴하다. 전체 가중치도 공개되어 있어 외부 API와 자체 인프라 가운데 워크로드에 맞는 방식을 선택할 수 있다.

V4 Flash가 맡는 경량 워크로드

DeepSeek은 V4 Pro와 함께 284B 파라미터 모델인 V4 Flash도 MIT 라이선스로 공개했다. V4 Flash의 활성 파라미터는 13B로, V4 Pro의 49B와 비교하면 약 4분의 1 수준이다. API 가격은 입력 $0.14/M, 출력 $0.28/M이며 V4 Pro보다 약 9.5배 저렴하다.

DeepSeek V4 패밀리9.5x 가격 차이V4 Pro1.6조 파라미터49B 활성$1.74/$3.48V4 Flash284B 파라미터13B 활성$0.14/$0.28복잡한 코딩장문 추론최고 성능빠른 응답비용 최적화경량 배포

자체 배포의 하드웨어 부담은 여전히 작지 않다. V4 Flash도 Q4_K_M 양자화 기준 약 180GB VRAM이 필요하고, FP16 전체 정밀도에서는 약 637GB VRAM을 요구한다. 성능 지표는 MMLU-Pro 86.3, Artificial Analysis Intelligence Index 47이며 V4 Pro의 52보다는 낮다.

V4 Pro는 복잡한 코딩과 장문 추론에, V4 Flash는 빠른 응답과 비용 중심의 작업에 배치할 수 있다. Claude Sonnet/Opus나 GPT-4o/o1처럼 역할이 다른 모델을 묶는 폐쇄형 패밀리 전략을 오픈웨이트로 구현한 최초의 성공적 사례 중 하나다.

API 비용과 자체 운영 사이의 선택

$1.74/M이라는 V4 Pro의 입력 가격은 MoE 희소 활성화가 제공하는 계산 비용 절감과 연결된다. 전체 가중치를 내려받을 수 있다는 점도 운영 모델을 바꾼다. 기업은 API 호출량만 비교하는 데서 그치지 않고, 자체 인프라의 초기 투자비와 운영 인력 비용까지 포함해 총소유비용을 판단할 수 있다.

V4 Pro를 FP16 전체 정밀도로 운영하려면 상당한 GPU 클러스터가 필요하다. 양자화 버전을 사용하면 소규모 GPU 클러스터에서도 운영할 수 있으며, 대용량 코드 생성 워크로드에서는 장기적으로 온프레미스 방식이 API 과금보다 유리한 경제성을 가질 수 있다. 외부 API로 데이터를 보내기 어려운 금융·의료·공공 도메인에서는 데이터 주권과 내부 처리 요건도 중요한 채택 동인이다.

MIT 라이선스는 상업적 재배포, 파인튜닝, API 서비스 구축을 포함한 활용을 허용한다. 기업 내부의 코딩 스타일과 도메인 프레임워크, 보안 정책을 반영한 모델을 만들거나 이를 제3자 서비스로 제공하는 방식까지 열려 있다.

코드 작업에 배치하는 방법

V4 Pro는 코딩 성능과 100만 토큰 컨텍스트를 함께 활용하는 작업에 맞는다. CI/CD 파이프라인에 연결하면 SWE-bench 수준의 소프트웨어 엔지니어링 태스크를 대상으로 코드 리뷰, 버그 수정, 테스트 케이스 생성을 자동화할 수 있다.

대규모 레거시 시스템에서는 수십만 줄 규모의 코드베이스를 단일 컨텍스트에 넣어 구조를 분석하고 리팩토링 전략을 세우는 용도로 사용할 수 있다. 전체 코드베이스를 대상으로 교차 파일 취약점 패턴을 찾는 보안 분석에서도 비용 우위를 활용할 수 있다.

가중치와 라이선스가 허용하는 범위에서는 내부 코딩 스타일, 도메인 특화 프레임워크, 보안 정책을 반영한 파인튜닝 모델도 구축할 수 있다. 반면 IDE의 실시간 코드 자동완성처럼 응답 속도와 단가가 더 중요한 작업에는 입력 $0.14/M의 V4 Flash를 배치하는 구성이 맞는다.

모델 도입과 함께 검토할 운영 쟁점

MoE 라우팅은 분산 시스템의 동적 부하 분산과 맞닿아 있다. 조 단위 모델을 학습하고 추론하려면 데이터 병렬화, 텐서 병렬화, 파이프라인 병렬화가 필요하다. 각 전문가가 독립적인 파라미터를 갖고 라우터가 필요한 전문가를 고르는 구조는 API 게이트웨이와 전문 서비스로 구성한 마이크로서비스 패턴에 빗대어 이해할 수도 있다.

보안과 컴플라이언스에서는 온프레미스 배포가 핵심이다. 외부 API 전송 없이 내부에서 데이터를 처리할 수 있어 데이터 주권 문제에 대응할 수 있다. 개인정보보호법, 금융보안원 가이드라인, 의료정보 규정이 적용되는 환경에서는 이 운영 방식의 의미가 더 커진다.

경제성 평가는 API 가격만으로 끝나지 않는다. 초기 인프라 투자비용, 운영 인력 비용, API 과금 절감 효과를 함께 놓고 손익분기점을 계산해야 한다. 오픈웨이트는 모델 감사 가능성, 설명가능성, 편향 검증을 높일 수 있지만 악용 가능성도 함께 키운다. 따라서 배포 자유도와 AI 거버넌스 통제를 같은 설계 안에서 다뤄야 한다.

오픈웨이트 모델 시장이 보내는 신호

V4 Pro의 LiveCodeBench 93.5점은 오픈웨이트와 폐쇄형 모델의 성능 격차가 줄어들고 있음을 보여준다. 적어도 이 평가에서는 GPT-5.5와 동등하거나 더 높은 결과를 냈으며, 최고 성능을 얻으려면 반드시 폐쇄형 API를 선택해야 한다는 전제를 흔든다.

Pro와 Flash를 함께 제공하는 모델 패밀리 전략도 두드러진다. Llama, Mistral, Gemma 등 주요 오픈웨이트 패밀리가 유사한 다중 계층 구조를 채택하고 있으며, V4 Pro와 V4 Flash도 서로 다른 비용·성능 요구를 한 제품군 안에서 받는다.

MoE는 프런티어급 오픈웨이트 모델의 주요 구조로 자리 잡고 있다. Dense 모델보다 유리한 파라미터 효율과 추론 비용이 확인되면서 앞으로도 MoE 기반으로 수렴할 것으로 전망된다. 동시에 GitHub Copilot, Cursor와 AI 코딩 어시스턴트 시장이 성장하면서 코딩 벤치마크가 범용 LLM을 선택하는 핵심 기준으로 부상하고 있다.

DeepSeek V4 Pro가 제시하는 선택지는 단순히 저렴한 API가 아니다. 1.6조 파라미터 MoE, 입력 $1.74/M과 출력 $3.48/M의 가격, MIT 오픈웨이트, 그리고 V4 Flash와의 역할 분담을 한데 묶었다. 기업은 이 조합을 기준으로 폐쇄형 API 의존도, 코드 워크로드 비용, 온프레미스 인프라와 AI 거버넌스 전략을 다시 설계할 수 있다.

Sources

DeepSeek오픈웨이트 LLMMoE코딩 모델온프레미스 AI