Qwen3.8 Max 프리뷰의 오픈웨이트 도입 판단
Qwen3.8-Max-Preview의 멀티모달 MoE 구조, 온프레미스 TCO, 데이터 주권과 벤더 종속 리스크를 검토한다.
2026-08-30 · 최초 발행 2026-07-21
2026년 7월 19일 WAIC가 열린 상하이에서 Alibaba Qwen 팀은 Qwen3.8-Max-Preview를 공개했다. 총 2.4조(2.4T) 파라미터의 멀티모달 플래그십으로, Alibaba는 내부 평가에서 Anthropic Claude Fable 5 다음의 세계 2위 수준이라고 주장했다. Moonshot의 Kimi K3가 실제 오픈웨이트로 출시된 직후 나온 발표라는 점도 경쟁 구도를 선명하게 만든다.
다만 지금은 프리뷰 단계다. 총 파라미터 수 외에 활성 파라미터, 모델 카드, 공식 벤치마크 점수는 공개되지 않았고 Hugging Face 모델 카드도 없다. 공개 예정인 오픈웨이트를 기다리기보다, 현재 확인 가능한 범위와 불확실성을 분리해 판단해야 한다.
프리뷰 모델에서 확인된 범위
Qwen3.8-Max-Preview는 Qwen 팀이 처음 내놓은 1조 파라미터 초과 멀티모달 모델이다. Alibaba Token Plan 구독과 Qoder·QoderWork 에이전트 플랫폼에서 제공되며, 프리뷰 기간에는 표준가의 10%로 과금된다.
오픈웨이트는 “곧(soon)” 공개하겠다고 예고됐지만 일정은 확정되지 않았다. 현 시점의 제공 표면은 Alibaba 운영 환경에 한정된다. 따라서 오픈웨이트 모델로서의 배포 자유도나 실제 라이선스 조건까지 이미 확보됐다고 보기는 어렵다.
단일 백본에 모달리티를 결합하는 방식
Qwen3 계열의 설계 패러다임을 잇는 이 모델은 초대규모 백본과 Sparse Mixture-of-Experts(MoE)를 전제로 한다. 쿼리마다 전체 파라미터를 모두 활성화하는 대신 일부 전문가만 선택해 연산하며, Qwen3-235B-A22B와 Qwen3-30B-A3B와 같은 계열의 접근이다. global-batch load balancing loss는 전문가 간 라우팅 쏠림을 완화하기 위한 요소로 제시됐다.
텍스트, 이미지, 비디오, 문서를 하나의 백본에서 처리하는 통합 학습 구조와 1M(100만) 토큰 컨텍스트 윈도우도 핵심 특징이다. 장문 문서와 코드베이스 전체를 다루는 사용처를 겨냥한다.
서빙에서는 활성 전문가만 연산하므로 전체 2.4T를 매번 계산하는 구조보다 이론적 처리량 이득을 기대할 수 있다. 그러나 전체 가중치 자체는 VRAM에 상주해야 한다. 활성 파라미터가 공개되지 않은 상태에서는 실제 추론 연산량과 비용을 산정할 수 없다.
온프레미스 여부는 데이터 요건에서 출발한다
685B급 DeepSeek-V3.2도 심각한 인프라 프로젝트인데, Qwen3.8은 약 3.5배 규모다. 2.4T 가중치를 상주시킬 자체 환경은 다수의 H100/H200 노드 클러스터와 텐서·파이프라인 병렬화를 요구하므로, 데이터센터 없이 운영하기는 비현실적이다.
오픈웨이트가 공개되더라도 대다수 조직은 자체 GPU보다 추론 제공사(inference provider)를 통해 소비할 전망이다. 자체 GPU 클러스터의 TCO에는 GPU 감가, 전력, 냉각, 상면, 운영 인력이 포함된다. 상용 API의 종량 과금과 비교하면, 온프레미스는 대량·상시 트래픽에서만 손익분기에 도달한다.
반면 데이터 잔류(residency) 의무는 오픈웨이트의 실질적 가치를 높인다. 온프레미스나 자국 인프라에서 서빙하면 데이터 잔류 요구를 충족할 수 있기 때문이다.
라이선스도 아직 확정된 판단 재료가 아니다. Qwen3.8의 라이선스 텍스트와 모델 카드는 부재하며, Qwen3.5·3.6은 Apache 2.0이다. 공개 시점에는 실제 라이선스 조건을 다시 검증해야 한다. 프리뷰가 Alibaba 운영 표면에만 존재하는 동안에는 대체 모델을 포함한 멀티벤더 폴백 체계도 미리 설계할 필요가 있다.
품질, 효율, 개방성은 같은 축이 아니다
원본 비교에서 Claude Fable 5는 품질과 코딩의 최상위 자리를 유지하며, Qwen3.8 Max는 전반적인 출력 품질에서 여전히 뒤처지는 것으로 정리된다. Qwen3.8 Max는 프론트엔드 코딩과 SVG 생성에 강점을 보이고 3D·초기 프로토타이핑에 유효하지만, 고품질 게이밍 비주얼에는 미흡하다.
GPT-5.6은 저비용 에이전트 작업의 효율 측면에서 우위로 제시된다. 이 비교에서 “최고”라는 평가는 품질, 효율, 가성비로 나뉜다. 중국 오픈웨이트 모델군은 “충분히 좋은” 품질의 가격을 붕괴시키는 중이며, 폐쇄 프론티어 대비 일부 비용이라는 흐름도 함께 언급된다.
| 구분 | Qwen3.8 Max | Claude Fable 5 | GPT-5.6 | Kimi K3 |
|---|---|---|---|---|
| 총 파라미터 | 2.4T (MoE) | 비공개(상용) | 비공개(상용) | 오픈웨이트 |
| 개방성 | 오픈웨이트 예고("곧") | 폐쇄 API | 폐쇄 API | 실제 오픈웨이트 |
| 라이선스 | 미공개(3.6은 Apache 2.0) | 상용 약관 | 상용 약관 | 오픈 라이선스 |
| 멀티모달 | 텍스트·이미지·비디오·문서 | 멀티모달 | 멀티모달 | 멀티모달 |
| 컨텍스트 | 1M 토큰 | 대용량 | 대용량 | 대용량 |
| 대표 강점 | 프론트엔드 코딩·비용 | 품질·코딩 최상위 | 효율·에이전트 가성비 | 개방성·가격 |
| 독립 평가 | 미검증(자사 주장) | 3자 벤치 상위 | 3자 벤치 상위 | 3자 벤치 등재 |
개방성 측면에서 Kimi K3는 실제 오픈웨이트로 출시됐다. GLM 5.2·DeepSeek V4·MiniMax M3·Qwen 3.6은 MIT/Apache 라이선스로 개방돼 있다. Qwen3.8 Max는 이들과 달리 공개 예고 단계에 머문다.
내부 순위 주장을 채택 근거로 삼기 어려운 이유
“Fable 5 다음 2위”라는 순위는 Alibaba 내부 평가에 의존한다. Artificial Analysis·LMArena 등 독립 평가기관의 점수가 없어 재현하거나 반증하기 어렵다.
Qwen3.7-Max 출시 때와 달리 Qwen3.8-Max-Preview에는 모델 카드, 활성 파라미터, 벤치마크 스코어, 기술 스펙이 공개되지 않았다. Alibaba 운영 표면에서만 작동하는 프리뷰라는 조건도 평가 환경과 프롬프트 통제 여부를 불투명하게 만든다.
벤더 자체 벤치마크만으로 채택을 결정하기보다 조직의 실제 워크로드에서 재현 가능한 A/B 평가를 선행해야 한다. 특히 MoE 모델에서는 총 파라미터 수보다 활성 파라미터가 실제 연산과 비용의 결정 변수다. 총량은 마케팅 지표로 볼 여지가 있다.
모델 선택을 거버넌스 문제로 다루기
AI 모델 선정은 성능과 비용 비교에 그치지 않는다. 개방성, 라이선스, 데이터 잔류, 벤더 종속을 함께 고려하는 다기준 의사결정(MCDA)이 필요하다.
학습과 추론에서 데이터가 어디에 남고 어디로 전송되는지 명세해야 하며, 개인정보와 영업비밀의 국외 이전도 통제 대상이다. 프리뷰가 China 국가정보법(National Intelligence Law) 적용을 받는 Alibaba 운영 표면에 존재한다는 점은 서구 리뷰어의 보안 우려와 연결된다.
이 우려는 호스팅 API에 귀속된다. US·EU 인프라에서 오픈웨이트를 자가 호스팅하는 경우에는 완화할 수 있으며, 데이터 잔류 의무가 있는 조직에서는 오픈웨이트 공개가 결정적인 의미를 가질 수 있다.
도입 통제에는 라이선스 텍스트 확정, 모델 카드와 데이터 출처 확인, 재현 벤치마크, 폴백 이중화, 감사 추적(audit trail)이 포함돼야 한다. 모델 버전, 프롬프트, 출력 이력은 형상관리(SCM)와 연결하고, AI 모델 도입 자체를 정보시스템 감리 대상에 포함할 수 있다.
오픈웨이트와 상용 API를 나누는 기준
초대형 오픈웨이트 모델은 데이터 주권, 커스터마이징, 장기 비용 통제에 유리하다. 대신 초기 인프라와 운영 부담이 크다. 상용 API는 최신 품질을 즉시 사용할 수 있고 운영 부담이 적지만, 종량 비용, 데이터 이전, 벤더 종속 리스크를 안는다.
민감 워크로드는 온프레미스 오픈웨이트에 배치하고 범용·버스트 트래픽은 상용 API로 처리하는 하이브리드 구성이 한 가지 선택지다. 2026년에는 폐쇄 프론티어 모델이 2세대를 연속 유지한 뒤 최대 모델의 개방을 선언하면서, 개방과 폐쇄의 경계가 전략적으로 흔들리고 있다.
“곧”이라는 공개 약속은 일정 미확정 상태다. 오픈웨이트가 실제로 공개되기 전까지 Qwen3.8-Max-Preview는 PoC에 한정하고, 프로덕션은 검증된 폴백으로 운영하는 편이 맞다.
Sources
- Alibaba Previews Qwen3.8-Max, a 2.4 Trillion-Parameter Multimodal Model (MarkTechPost)
- Alibaba says newest Qwen AI model second only to Anthropic's Claude Fable 5 (SCMP)
- Alibaba unveils Qwen3.8-Max Preview with 2.4T parameters; open weights coming soon (FoneArena)
- Qwen 3.8 Max vs Fable 5: is Alibaba's AI Closing the Gap? (Geeky Gadgets)
- Qwen3.8: 2.4T Parameters, Open Weights, No Benchmarks (Techsy)
- Qwen3-Max: Just Scale (Qwen 공식 블로그)
- Alibaba Launches Qwen 3.8 With 2.4 Trillion Parameters (MLQ News)