중국 오픈웨이트 LLM 경쟁과 AI 플랫폼 선택 전략

DeepSeek, Qwen, GLM, ERNIE를 중심으로 중국 LLM의 비용·성능, 데이터 주권, 온프레미스 배포와 라우터 전략을 분석한다.

2026-08-14 · 최초 발행 2026-08-02

짧은 출시 간격이 바꾼 LLM 가격 기준

2026년 4월 DeepSeek V4 프리뷰가 가격과 성능의 기준점을 제시한 뒤, 중국 AI 기업들은 빠르게 대응했다. Qwen 3.7, DeepSeek V4 Pro, GLM-5.2, ERNIE 5.1, Hunyuan 3.0, Doubao Pro가 2주 이내에 연이어 등장하면서 GPT-4급 성능을 기존 대비 최대 97% 낮은 API 비용으로 제공하기 시작했다.

이 흐름은 개별 제품의 동시 출시만으로 보기 어렵다. MoE 아키텍처의 확산, 공개 벤치마크 순위 경쟁, DeepSeek가 촉발한 저가 API 정책이 맞물리며 기업의 AI 플랫폼 선택 기준 자체를 흔들었다.

모델 회사 출시 시기 주요 특징
Qwen 3.7 Max Alibaba 2026년 5월 19일 SWE-Verified 80.4%, 오픈웨이트 예정
DeepSeek V4 Pro DeepSeek 2026년 4월 24일 1.6T 파라미터(MoE), $0.435/1M 입력
Hunyuan 3.0 Tencent 2026년 6월 406B/32B 활성, Think/Instruct 변형
ERNIE 5.1 Baidu 2026년 5월 9일 학습비용 동급 대비 6%, AIME26 99.6%
Doubao Pro ByteDance 2026년 6월 주간 활성 1.55억 명, GPT-5.2급 1/10 비용
GLM-5.2 Z.ai(Zhipu) 2026년 6월 17일 753B/MIT 라이선스, Intelligence Index 51점
DeepSeek V4 프리뷰 출시(2026년 4월)가격-성능벤치마크 설정Alibaba: Qwen 3.7 MaxBaidu: ERNIE 5.1Tencent: Hunyuan 3.0ByteDance: Doubao ProZ.ai: GLM-5.22주 동시 릴리즈경쟁적 수렴글로벌 API 가격97% 하락 완성기업 AI 플랫폼재선택 시대오픈소스 자체 호스팅중국 API 활용기존 클로즈드 모델 유지

MoE와 어텐션 최적화가 만든 비용 구조

DeepSeek V4 Pro는 총 1.6T 파라미터 가운데 토큰당 49B만 활성화하는 MoE 구조를 사용한다. 활성 비율은 약 3%이며, 1M 토큰 컨텍스트를 지원한다. CSA(Compressed Sparse Attention)는 희소 패턴으로 어텐션 연산량을 줄이고, HCA(Heavily Compressed Attention)는 KV 캐시를 극단적으로 압축한다. 두 기법을 함께 적용해 긴 컨텍스트 처리를 실용화했다.

V3.2와 비교하면 추론 FLOPs는 27% 수준으로 줄었고, KV 캐시는 10% 수준으로 줄었다. 경량 변형인 DeepSeek V4 Flash는 총 284B 파라미터와 활성 13B 파라미터로 구성된다.

Qwen 3.7 Max는 Qwen 3.6 Plus의 하이브리드 어텐션 구조를 계승해 고도화했다. MTP(Multi-Token Prediction)로 단일 포워드 패스에서 여러 토큰을 예측하고, Gated DeltaNet 하이브리드로 선택적 상태 갱신을 수행해 긴 컨텍스트 처리 효율을 노린다. 2026년 6월 중후반 공개 계획에는 단일 GPU 배포가 가능한 27B 덴스 모델과, 활성 파라미터 3B의 35B-A3B MoE 변형이 포함됐다. SWE-Verified에서는 80.4%를 기록해 Claude Opus 4.6과 동급으로 제시됐다.

Z.ai(구 Zhipu AI)의 GLM-5 계열은 화웨이 Ascend 910B 칩 전용 학습 파이프라인을 구축했다. GLM-5는 총 744B 파라미터, 활성 40B 파라미터, 28.5T 토큰 사전학습, SWE-bench Verified 77.8%의 사양으로 소개됐다. GLM-5.2는 총 753B 파라미터와 1M 토큰 컨텍스트를 제공하며, MIT 라이선스로 상업적 활용이 가능하다. Intelligence Index v4.1에서는 51점으로 DeepSeek V4 Pro의 44점보다 높았고, FrontierSWE에서 GPT-5.5를 능가하면서 비용은 1/6 수준으로 제시됐다.

ERNIE 5.1은 ERNIE 5.0 대비 총 파라미터를 1/3 수준으로, 활성 파라미터를 1/2 수준으로 줄였다. 동급 프론티어 모델 학습 비용의 약 6%로 달성됐으며 AIME 2026에서 99.6%, LMArena Search 리더보드에서 1,223점으로 글로벌 4위와 중국 모델 중 1위를 기록했다. 중국어 법률·금융 도메인 데이터도 대규모로 학습했다.

Hunyuan 3.0은 총 406B 파라미터와 32B 활성 파라미터를 사용하는 MoE 모델이며, 컨텍스트 길이는 256K다. Think 변형은 확장 CoT(Chain-of-Thought)를 통해 복잡한 추론 작업에 맞추고, Instruct 변형은 저지연 응답과 실시간 인터랙티브 애플리케이션을 겨냥한다. 텍스트·이미지·비디오 통합 처리도 지원한다.

API 가격과 벤치마크를 함께 읽는 법

모델 입력($/1M 토큰) 출력($/1M 토큰) 성능 등급 오픈소스
GPT-5.5 5.00 30.00 최상위
GPT-5.4 2.50 15.00 최상위
Claude Opus 4.8 5.00 25.00 최상위
Gemini 3.1 Pro 2.00 12.00 상위
DeepSeek V4 Pro 0.435 0.87 최상위 동급
DeepSeek V4 Flash 0.14 0.28 상위
GLM-5.2 ~2.00 ~6.00 최상위 동급
Qwen 3.7 Max 클로즈드 클로즈드 최상위 동급 예정

DeepSeek V4 Flash의 캐시 히트 입력 가격은 $0.0028/1M이며, 캐시 미스 대비 98% 절감으로 제시됐다. 반복 패턴이 많은 RAG와 에이전트 워크로드에서는 총비용을 80% 이상 줄일 수 있다.

GPT-4급 모델의 API 입력 가격은 2023년 초 $30/1M에서 2026년 현재 $1 미만으로 약 97% 하락했다. 중국 오픈소스 모델의 경쟁 압력은 이 하락을 이끈 주요 요인 가운데 하나다.

모델 BenchLM SWE-bench Verified Intelligence Index AIME 2026
GPT-5.4 88
DeepSeek V4 Pro 87 44점
GLM-5.2 51점
GLM-5 77.8%
Qwen 3.7 Max 80.4%
ERNIE 5.1 99.6%
Kimi K2.6 81

DeepSeek V4 Pro의 BenchLM 87점은 GPT-5.4의 88점과 사실상 동급으로 제시됐고, API 가격은 약 1/10 수준이다. Qwen 3.7 Max의 SWE-Verified 80.4% 역시 Claude Opus 4.6과 동등한 코딩 능력을 시사한다.

모델 학습 하드웨어 학습 기간 학습 비용
GPT-4 (추정) A100 수만 장 수개월 $1억 달러 이상
DeepSeek R1 H800 2,000장 55일 $600만 달러 이하
ERNIE 5.1 미공개 미공개 동급 모델의 6%
GLM-5 Ascend 910B 미공개 미공개

DeepSeek R1의 $600만 달러 학습 비용은 GPT-4 추정 비용인 $1억 달러 이상 대비 약 6% 수준이다. 학습 효율화가 단순한 주장에 그치지 않는다는 근거로 제시된다.

데이터와 운영 조건에 따라 모델을 고른다

모델 선택은 성능 순위만으로 결정되지 않는다. 데이터 주권, 예상 API 월 비용, 반복 추론량, 온프레미스 인프라와 ML 운영 역량이 함께 작동한다.

금융·의료·공공(규제 업종)일반 업종보유미보유$1,000 이상/월$1,000 미만/월높음 (RAG·배치)낮음 (프로토타입)있음없음기업 AI 도입의사결정 시작데이터 주권요구사항?온프레미스인프라 보유?예상 API 비용?오픈웨이트 자체 호스팅(DeepSeek/Qwen/GLM)국내 클라우드 API(데이터 레지던시 보장)반복 추론워크로드?클로즈드 API(GPT/Claude/Gemini)DeepSeek V4 Pro/FlashAPI 활용 + 캐시 최적화 ML운영 역량?오픈웨이트 도입온프레미스 배포컴플라이언스 달성데이터 주권 확보비용 60-80% 절감성능 동급 유지장기 TCO 최적화벤더 락인 방지

금융·의료·공공처럼 외부 서버 전송이 허용되지 않는 데이터, 토큰 소비가 큰 RAG 파이프라인과 배치 문서 처리, 내부 규정이나 고객 계약으로 클라우드 API를 쓸 수 없는 환경은 오픈소스 도입 검토 대상이다. 한중일 다국어 특화가 필요한 경우에도 Qwen과 GLM 계열을 후보로 둘 수 있다.

반대로 빠른 프로토타이핑, ML 운영 인력이 없는 소규모 팀, 이미지·오디오·비디오 처리가 통합된 멀티모달 기능이 중요한 경우에는 클로즈드 API가 더 적합할 수 있다.

라우터로 요청을 분리하는 비용 최적화

모든 요청을 하나의 모델에 보내는 대신, 요청 특성에 따라 계층을 나누는 방식이 제시된다.

계층 모델 유형 비용(입력/1M) 적합 워크로드
라우터 경량 분류 모델 $0.10 이하 요청 분류, 의도 파악
경량 추론 DeepSeek V4 Flash $0.14 FAQ, 간단 요약, 번역
표준 추론 DeepSeek V4 Pro $0.435 일반 분석, 코드 생성
플래그십 GPT-5.4 / Claude $2.50~5.00 복잡 추론, 창의적 작업

라우터 모델은 입력의 복잡도·도메인·긴급도를 분류한다. 전체의 6070%에 해당하는 단순 요청은 최하위 계층으로 보내고, 복잡한 요청만 플래그십 모델로 에스컬레이션한다. 이 방식은 동등한 출력 품질을 유지하면서 총 API 비용을 6080% 절감하는 전략으로 제시된다.

자체 인프라 배포는 초기 비용이 들지만 장기 TCO 관점에서 유리할 수 있다. 2026년 클라우드 GPU 비용 기준으로 A100 40GB는 시간당 $0.50~$1.50, H100 80GB는 시간당 $1.50~$3.50, H200 141GB는 시간당 $3.00~$5.00다.

풀 파라미터 배포는 최고 품질을 목표로 하지만 DeepSeek V4 Pro에 H100 16장 이상이 필요한 대규모 GPU 클러스터 방식이다. 4비트 양자화 배포는 품질 손실을 5% 미만으로 두면서 GPU 메모리를 75% 줄이는 방식이며 llama.cpp, vLLM + AWQ가 언급된다. Qwen 3.7 27B 덴스 같은 엣지 최적화 버전은 RTX 4090 단일 GPU에서 로컬 추론이 가능하다.

중국 모델을 사용할 때 데이터 경로를 먼저 확인한다

중국 모델 활용에서 핵심은 모델의 국적보다 추론이 실행되는 위치다. Hugging Face 또는 ModelScope에서 가중치를 받아 자체 인프라에서 실행하면 데이터는 중국 서버로 전송되지 않으며 GDPR·PIPA 컴플라이언스를 달성할 수 있다. GLM-5.2는 MIT 라이선스로 상업적 활용 제한이 없고 라이선스 리스크를 최소화한다.

반면 DeepSeek API를 직접 사용하면 추론은 DeepSeek의 중국 데이터센터를 통해 처리된다. EU GDPR에서는 개인정보의 중국 이전이 적정성 결정 없는 제3국 이전으로 위반 소지가 있고, 한국 PIPA는 개인정보 국외 이전에 정보주체 동의 또는 표준 계약 체결 의무를 둔다. 미국 HIPAA는 헬스케어 데이터의 외부 전송을 제한하며, 금융 업권에서는 금융위원회 가이드라인상 고객 금융 데이터의 해외 AI 서버 전송이 제한된다.

미국 수출 규제(EAR)는 중국으로의 첨단 GPU 판매를 제한하지만, 중국산 오픈소스 모델 가중치의 다운로드·활용은 규제 대상이 아니다(2026년 6월 기준).

개인정보·금융정보·의료정보가 담긴 워크로드는 오픈웨이트 자체 호스팅이 필수로 제시된다. 공개 정보와 내부 문서의 비개인화 처리는 API 직접 사용을 검토할 수 있으며, 법무팀과 협의해 데이터 분류(Data Classification)에 따른 모델 라우팅 정책을 수립하는 접근이 권장된다.

한중일 언어와 전문 도메인에 대한 선택지

중국 프론티어 모델은 영어 중심 모델과 달리 한중일(CJK) 언어 특화 학습을 중요한 설계 목표로 둔다.

모델 다국어 강점 특화 도메인
Qwen 3.7 한·중·일·아랍어 동아시아 비즈니스, 코딩
GLM-5.2 중·한·일 중국어 법률·금융
ERNIE 5.1 중국어 특화 중국 법규·의료
DeepSeek V4 다국어 범용 수학·코딩

Qwen 3.7은 한국어 성능이 GPT-4급에 근접하며, 오픈웨이트 공개 뒤 온프레미스 한국어 서비스를 구축하는 현실적인 선택지로 제시된다. GLM-5.2는 MIT 라이선스를 바탕으로 한국어 법률·금융 문서 처리에 활용할 수 있고, DeepSeek V4 Flash는 한국어 번역·요약처럼 대용량 저복잡도 워크로드를 저비용으로 처리하는 후보가 된다.

플랫폼 평가에 쓰이는 핵심 개념

MoE(Mixture of Experts)는 하나의 대형 신경망 대신 다수의 전문화된 소형 네트워크인 전문가를 두고, 라우터가 입력에 맞춰 일부 전문가만 활성화하는 희소 아키텍처다. DeepSeek V4 Pro는 1.6T 가운데 49B를 활성화하는 약 3%의 스파스 활성화 사례다. 총 파라미터가 늘어나도 추론 비용 증가 없이 용량을 확장할 수 있으며, 동일 추론 비용 대비 더 많은 학습 용량으로 Dense 모델을 능가할 수 있다. 조건부 계산(Conditional Computation), 게이팅 네트워크(Gating Network), 부하 균형(Load Balancing Loss)가 관련 키워드다.

오픈웨이트와 오픈소스는 같은 의미가 아니다.

구분 오픈웨이트(Open Weight) 진정한 오픈소스(Open Source)
가중치 공개
학습 데이터 공개
학습 코드 공개
상업적 자유 활용 모델별 상이 라이선스 따름
사례 Qwen 3.7, DeepSeek GLM-5.2(MIT), Llama

대부분의 중국 모델은 오픈웨이트 수준이며, GLM-5.2의 MIT 라이선스는 예외적으로 완전한 자유 활용을 보장한다.

주요 모델 포지셔닝GPT-5.4성능↑ 비용↑DeepSeek V4 Pro성능↑ 비용↓Qwen 3.7 오픈웨이트성능↑ 컴플라이언스↑GLM-5.2 MIT성능↑ 자유도↑AI 플랫폼 평가성능(벤치마크 점수)비용(API + 인프라 TCO)컴플라이언스(데이터 주권·규제)지연시간(응답속도 SLA)다국어(한국어 품질)지속성(벤더 안정성)

평가 항목에는 추론 서버(vLLM/TGI)·로드밸런서·캐싱 계층을 포함한 AI 서비스 아키텍처, 개인정보 처리방침과 모델 선택의 관계, GPU 구매·임대 CapEx와 API 종량제 OpEx의 BEP(손익분기점), 단일 API 의존도와 멀티벤더 전략이 포함된다.

전문화로 갈라지는 중국 LLM 생태계

2026년 하반기에는 단순 성능 순위보다 전문 분야별 분화가 두드러질 전망이다.

기업·모델 전문화 방향 핵심 경쟁력
DeepSeek 코딩·수학·저비용 최저 API 가격, 오픈웨이트
Kimi (Moonshot) 에이전틱 코딩 자율 코딩 에이전트 특화
Tencent Hunyuan 멀티모달 폭넓음 텍스트·이미지·비디오 통합
ByteDance Doubao 최저비용 대중화 주간 1.55억 사용자, 소비자 AI
Alibaba Qwen 다국어·오픈웨이트 한중일 특화, 엣지 배포
Z.ai GLM 중국어 전문 도메인 법률·금융, MIT 완전 공개

GLM-5.2가 FrontierSWE에서 GPT-5.5를 1/6 비용으로 능가한 사례, ERNIE 5.1의 글로벌 리더보드 4위와 1,223점은 중국 모델이 클로즈드 모델의 품질 프리미엄과 영어 중심 평가에 도전하고 있음을 보여준다. DeepSeek V4.1, Qwen 3.7, GLM-5.2, Llama 4.5, Gemma 4가 포함된 오픈웨이트 다운로드 상위권에서 중국 모델 3개가 상위 3위를 점거하는 추세도 지속될 전망이다.

한국 기업은 단기적으로 DeepSeek V4 Flash API를 대용량 저복잡도 워크로드에 적용하고, 중기에는 Qwen 3.7 오픈웨이트 공개 후 온프레미스 파일럿을 구축할 수 있다. 장기적으로는 라우터 기반 멀티모델 아키텍처를 통해 비용·성능·컴플라이언스를 함께 최적화하는 방향이 제시된다.

Sources

중국 LLM오픈웨이트DeepSeekQwenAI 플랫폼데이터 주권